人类还能在AI研究中扮演多久核心角色?前OpenAI研究副总裁:人类研究员的时间还剩2年(5)

2026-08-28 15:35  华尔街见闻

杰瑞 (Jerry):嗯,是的,那条推文太棒了。

主持人 (Host):那么你们是怎么考虑这个问题的?对你来说,什么样的人类才算是具有计算效率的?

杰瑞 (Jerry):这是一个好问题,在某种程度上,对人类来说,计算和时间是密切相关的。我们在单位时间内能使用的计算量可能就是固定的。所以问题主要在于我们如何分配我们的时间,如何消耗我们的精力?但显然,我们有办法更好地分配这些东西,主要关注点在于什么是我们能做的杠杆率最高的努力。

主持人 (Host):我想在你的愿景中……我们常听说,研究方向是优化过程中最困难的部分,在完全自动化的实验室背景下,你可能仍然需要人类的辨别力来指定某个特定的研究方向。那么你们是如何考虑这一点的?你预测人类还需要多长时间必须稳定地留在这一研究循环(loop)中?

杰瑞 (Jerry):这是个好问题。我们还有一些时间。我粗略估计,人类研究员在 AI 研究发现过程中继续扮演重要角色,至少还有两年的时间。我觉得就像你现在经常能听到 AI 领域的研究员们在重复这句话:"哦,我们的工作只剩最后几天了,所以趁现在还能干就多干点,之后我们就可以全都休息了。"这个行业发展得非常快,在这行干了这么多年,在很多方面都让人感到极其疲惫和劳累。但是如果这确实是我们职业生涯和工作中最重要的一段时光,那这或许也是值得的。

我认为,我们必须让智能体对研究领域和研究方向有更高层次的理解。任何人只要用过模型做研究都知道,智能体生成的洞见质量往往相当低。它们可能很有创造力,但生成想法的方式质量非常非常低,如果它们的想法很多样化,通常也不太好。目前还没有任何模型能够代表一个花了 10 年时间研究 AI 技术的人类,具备对我们真正正在处理的对象如此深度的理解。

主持人 (Host):在这里我要特别感谢我们的赞助商--Lovable。你知道那个你一直想开发的内部工具、副业项目或产品吧?如果没有 Lovable,你可能会浪费一个周末。有了 Lovable,你今天就可以直接发布软件。它包含一个你可以检查和更改的可编辑代码库,加上双向 GitHub 同步。Lovable 还负责处理后端和基础设施,包括托管 Postgres、对象存储、托管、支付等,所以你不必自己把一切连接起来。通过 Lovable 的 MCP 服务器,你可以直接从你已经使用的智能体创建和部署项目。用 Lovable 把想法变成人们喜爱的软件吧,网址是 lovable.dev。好了,回到我们的节目。

所以你的预测是,两年后,整个人工智能研究的闭环--也就是从头到尾--将完全实现自动化,而人类将无法发挥有意义的作用,就像人类在国际象棋中无法再发挥有意义的作用一样?

杰瑞 (Jerry):是的。

主持人 (Host):即使以这种"短时间线"的标准来看,这也是一个相当激进的短时间线预测。想想两年前,大概是 2024 年 8 月,我们有什么?那大概是 o1 发布前两三周的时候。当时最好的模型是 GPT-4o、Claude 3.5 Sonnet。它们仍然不太会做数学题,也不太会写代码。我想说,我们在这些领域已经取得了相当大的进展。但我们在其他领域,比如创意写作或一般的写作方面,并没有取得巨大的进展。我的聊天查询结果并没有比两年前好很多,甚至感觉今年模型出现了同质化(mode collapse)。我觉得任何编码智能体的 UI 都大同小异,模型生成的语言也趋同于同一种风格。那么,我们如何从现在走到所有 AI 研究的完全自动化,以至于在两年后,人类完全成为一种多余的存在?

杰瑞 (Jerry):是的。我觉得如你所知,显然有一条路径是直接扩展当前的方法;还有一条路径是我们在未来两年内会有什么新发现。但我会说,就像你所问的,回想过去两年,我们在哪里取得了最大的进展,我们在创意写作、数学或者编程领域是否在进步?很多这些问题几乎都要看激励机制。目前,实验室显然有巨大的动力去关注编程,关注使用 AI 模型来自动化知识工作。而在创意写作方面,让模型变得非常出色需要付出大量的努力,实验室不太确定是否能证明这些成本的合理性。有时候人们会想,为什么某些领域发展得快,某些领域发展得慢?很多时候,这并不受限于研究能力,而是受限于经济激励。训练模型非常昂贵,无论外界是否看得出来,实验室为了生存,在经济优化上都是极其残酷的。因为如果你不是拥有最大算力资源(compute footprint)的实验室,那你就会……