首次揭秘 o1/o3 突破内幕:强化学习与算力的奇迹
作为 OpenAI o系列(推理模型)的核心开发者,Jerry 也首次在访谈中回顾了这一颠覆性突破背后的故事。
早在2019年初,Ilya Sutskever 就在全员大会上精准描绘了通往AGI的路线图:"我们需要用能得到的所有数据训练一个巨大的生成模型,然后我们需要用强化学习(RL)进行训练。"
方向虽然明确,但执行之路却漫长而坎坷。Jerry透露,GPT-3 开始训练时,他的第一反应就是如何用它做强化学习。初代的 Codex 就是大语言模型结合强化学习的实验产物。然而,受限于数据、算法和实验设置,团队在很长一段时间内都无法将其有效扩展。
"这些东西当时都在后台默默酝酿。很长一段时间里,尝试都没有取得巨大的收益。"
转机来自于一次"生命的迹象"以及领导层的果断决策。当模型终于在强化学习下展现出可能奏效的微弱火花时,首席科学家 Jakub Pachocki 敏锐地抓住了机会:"杰瑞,现在我们有了这些 GPU。看看我们是否能开始扩展这个,是否能把现有的结果做大做强。"
在算力匮乏的AI实验室里,"先有鸡还是先有蛋"(先有成果还是先给算力)是永恒的难题。但正是高层"放手去干"的算力倾斜,点燃了整个团队。
"这让我们激动万分。我们付出了三倍的努力,去思考需要什么样的数据集、系统和实验来证明它可以持续扩展。兴奋带来了实验结果,结果又创造了势头。" 最终,通过将强化学习的规模提升数个数量级,震惊行业的 o1、o3 推理模型得以面世。
终极愿景:"公司级AI"与后劳作时代的狂想
谈及 Core Automation 的未来产品,Jerry 的目光超越了单纯的AI模型。
"我们想把自己的公司打造成世界上最自动化的公司,并且将其作为蓝图。我们要构建出一个类似'公司大脑'的东西,集中所有的公司信息,员工通过终端连接,成为一个公司 AI 的用户。"
当被问及如果大大小小的公司最终都实现了完全自动化,人类的未来将何去何从时,Jerry 给出了一个充满哲学意味的"后劳作(post-labor)时代"设想。
官僚作风最重的大公司将最先被自动化,AI将接管信息的传递与流程的优化。这意味着,人类十万年来为了生存而不得不进行的"人肉执行"将逐渐走向终结。如果矿山能自主运作提供资源、软件能自我修复漏洞并开发新功能,人类就不再需要为了世界运转而强迫自己苦逼地"打工"。
但这并不意味着劳动的绝对终结。Jerry 认为,未来的焦点将转向"人类增强(human augmentation)"与追求极致的伟大。
"我有点像在想象这样一个世界:我们生活得像古希腊哲学家一样,在广场上聚会,整天互相讨论哲学、锻炼身体,做一些我们想做的事。人类应该努力在身体和精神上变得伟大,就像今天的职业体育一样,没有经济理由去做,但我们为了追求伟大而努力。这才是对我们来说最重要的部分。"
随着倒计时两年的时钟滴答作响,无论是AI研究员,还是所有身处知识经济浪潮中的普通人,或许都到了该重新思考"工作"定义的时候了。










