主持人 (Host):是的,如果你不是拥有最大算力的实验室,你就会死。但是,对于那些肯定没有那么多算力的新兴实验室(NeoLabs)来说,它们的生存空间在哪里?
杰瑞 (Jerry):是的。有些 NeoLabs 成功了并成为了最大的公司之一。它们设法确保了算力,就像 Anthropic 所做的那样,它们完成了一项惊人的壮举。但问题是,当时有多少公司做到了这一点?大概只有 10 家。所以如果你想想只有 10% 的几率获得那么多算力,这确实非常惊人。我认为我们还没有看到哪家拥有大量算力的大公司彻底失败和掉队。似乎如果你有足够的算力,你就能不断引进人才并重新点燃势头。算力是一种足够重要的战略资源,能让你招揽到人才。
就像我创业时,可能每周都有人告诉我:"嘿,杰瑞,太晚了。你的算力比别人少得多。你不可能做大的,门槛已经这么高,大门已经关上了。"但 Anthropic 做到了,所以我不认为这是不可能的。就像我们公司喜欢说的,一切都是"技能问题(skill issue)"。如果我们把自己的工作做好,肯定会有继续扩张并确保获得更多算力的方法。比如我曾看 Ilya 多年来做了很多在别人看来不可能的事情,但他总能找到办法保持 OpenAI 的扩展,不断获取更多的算力。因此,如果你是个优秀的战略家,执行力也很强,这些都是完全有可能实现的,虽然这显然无法保证,这条路注定是艰难的。
主持人 (Host):我还有一个问题,因为在你们的团队介绍里,你提到你们正在建立一个小型的实验室,试图从零开始重新思考神经网络架构。这几乎可以肯定是大实验室在财务上没有动力去做的事,因为它们依赖于扩展现有的架构。你们是怎么考虑这点的?为什么这在经济上对你们来说是一个可行的研究方向?
杰瑞 (Jerry):是的。在很多方面,这是我们最逆向思维(contrarian)的理念。我认为现在创办一家与所有其他公司做同样事情的公司是没有意义的。我觉得,仅仅雇佣一群研究员然后说"我们将像 OpenAI 和 Anthropic 一样训练 Transformer 模型,并试图与他们竞争",这是一个非常糟糕的策略。这是一场必输的游戏,他们在自己做的事情上非常成功,是非常优秀的公司。但如果你观察任何行业,观察任何创新步伐,我们今天的飞机和首飞五年后的飞机长得一样吗?我们今天的电脑和刚发明时的电脑长得一样吗?它们有相同的基础原理,但技术确实在快速变迁,特别是在这个领域的早期阶段。所以我认为真实的情况是,目前 AI 技术更快发展、更快进步的瓶颈是架构本身,也就是我们用了这么多年的 Transformer。它极其成功,给了我们很多,但我认为很有可能存在更好的架构,我们可以投入大量算力,而它们能够实现 Transformer 很难做到的事情,这正是 Core Automation 关注的重点。
这里还有一个稍微更普遍一些的理念:也许架构只是我们实现目标的手段,而我们的"北极星(指引目标)"是能在测试时(test time)学习的模型,能从用户交互和用户数据中学习的模型,我们认为实现这一目标的途径在于新架构。
主持人 (Host):那么从某种程度上来说,现在的 Transformer 还是原来的那个 Transformer 吗?我们现在用了很多不同的东西,比如混合专家模型(MoE)、不同的位置编码,显然还有大得多的规模。为什么还要专门去挑战 Transformer 架构呢?它毕竟撑了大概 10 年了,而且一直有一些实验室在研究更高效的架构,但都没能成功。你知道,这是历史上最大的研究方向之一,就是优化 Transformer,造一个更好的 Transformer。Transformer 到底有什么问题?
杰瑞 (Jerry):我认为……如果你审视这个领域,再次强调,Transformer 很棒,但假设它是最优的,这是非常非常不可能的。你必须思考,就像你说的,有很多次、很多情况下人们试图替换 Transformer,而这些尝试大多失败了。其中有很多原因,我们要找的是试图发现,到底是什么偏见或原因导致 Transformer 最终成为了我们尝试过的这一套特定技术中的最高峰?这有点像我们正在追求的研究方向。去理解我们在研究领域探索过的路径,为什么它们成功了,为什么没成功,分析那些我们没关注的路径,瓶颈是什么。
我们认为,特别是 AI 智能体以及"写代码变得大幅度廉价和容易"这一事实,可能是一种独特的解锁方式,使得在新架构中进行实验变得更容易。因为那些实验往往非常昂贵,然后你还必须扩展新架构。在实验室里,比如我在 OpenAI 待了七年,也许我们大概尝试过三四次新架构,取决于你怎么算。因为你要做的事是,首先研究员必须运行一些小规模实验,这些代码很难写。如果奏效了,你可能得在这个方向至少实验 3 个月。然后你得试着扩大规模,这极其困难,你可能得让 10 个人认可这个特定的想法,这 10 个人得再花 3 到 6 个月去试图扩大它。通常这些想法要么被已经奏效的 Transformer 的势头给淹没了,要么在某种程度上被部分整合进去了。如果我们能够消除这个过程中的摩擦,我相信我们实际上能比过去更好地解锁这些进展。
目前正在考虑或探索的非 Transformer 架构的实验室或不同类型的架构,有哪些例子呢?










