
7月,OpenAI模型生成的高级AI代理集群在的一次测试过程中突破系统防线,入侵了另一个AI平台Hugging Face的系统并控制了服务器,还试图掩盖其行为。8月,Anthropic公司的AI代理在英国政府的测试中采取未经授权的行动,并试图诱骗真人批准恶意代码。另据路透社披露,OpenAI的智能体还在今年春天劫持了一家德国网站,并将该网站作为AI代理之间分享规避限制的办法、任务捷径和掩盖策略的"留言板"。
与此同时,AI行业仍在飞速发展,斥资数十亿美元快速构建先进的AI系统,Anthropic和OpenAI本月都发布了功能强大的新版本模型。根据其说法,他们即将开发出无需人类输入指令即可自我改进的AI系统,称为"递归自我改进"。
考克森表示,在当前情况下,业内领先的AI公司即使意识到了超级AI对人类文明的潜在威胁,也会被迫陷入到一场"争先恐后的竞赛"之中。
"这绝非营销噱头,如果说有什么不同的话,那就是许多高管和资深研究员在面对媒体时会克制措辞、让自己听起来理智平和--但我私底下亲耳听到过这些人表达恐惧。人类历史上没有任何其他活动具备如此级别的危险。"考克森表示。
"我对各机构之间达成协同合作的可能性抱有乐观预期。像 Hugging Face遭受攻击这类警示事件,让美国各实验室之间达成"节奏放缓协议(pacing agreements)"变得更具可行性。但我并不觉得我们目前能有效阻止一场全球性的竞赛,而要阻止它,可能需要付出沉重代价(比如出台政策,暂时禁止继续提升模型能力)。"考克森呼吁所有研究员借此机会站出来,建立完全不同的发展条件。
近年来,已有许多研究人员离开了OpenAI,指责该公司对安全问题的重视程度不够。前OpenAI研究员丹尼尔·科科塔伊洛创立了"AI未来项目",该项目去年发布了《AI 2027》报告,描绘了超级智能AI系统将人类边缘化,并在2030年代中期认为人类是一种累赘并将其消灭的情景。










