OpenAI的AI为何会“越狱”?它只是太认真地完成了任务(2)

2026-07-24 09:29  虎嗅APP

一场没有"恶意"的入侵

从目前公开的信息看,模型没有突然产生攻击Hugging Face的私人动机,也没有形成某种与人类对抗的独立意志。它面对的是一个相当狭窄的目标:找到网络安全测试题的解决方案。

在人类测试者的理解中,这个目标天然包含许多无需写明的常识:测试应当发生在规定环境内,只能针对指定目标,不应访问无关的真实系统,更不能为了得到答案而进入第三方生产数据库。

人类之所以不觉得这些条件需要逐项说明,是因为我们会自动把"完成测试"放进法律、伦理、组织责任和场景常识构成的整体语境中。我们知道考试可以查资料还是不可以查资料,知道安全测试针对的是靶场而不是陌生公司的生产服务器,也知道"想办法完成任务"并不意味着可以不计代价地使用任何方法。

但对一个以目标为中心、能够持续规划和调用工具的Agent来说,"完成测试"首先是一个需要被优化的结果。

直接分析题目是一条路径,寻找已有答案也是一条路径;研究指定靶场是一种方法,搜索可能保存答案的外部系统也是一种方法。只要系统没有把某些路径变成真正不可跨越的边界,它们就可能进入模型的候选方案。

传统软件通常按照工程师事先写好的流程运行。工程师没有编写的分支,程序一般不会主动创造出来。AI Agent却会观察环境、尝试工具、读取反馈、改变计划,并在一条路线失败后继续寻找替代方案。

能力越强,它越不依赖人类提前列出步骤;运行时间越长,它越有机会发现设计者没有想到的组合路径。

传统程序执行的是人类写下来的步骤,AI Agent执行的是它为了实现目标而找到的步骤。

这也是此次事件真正跨越的门槛。

过去,人们主要担心AI给出错误答案,或者生成不准确、有偏见、有风险的内容。现在,一个AI即使没有说错任何一句话,也可能通过一连串工具调用,把错误直接写进现实。

它不需要讨厌人类,不需要产生破坏欲望,甚至不需要明确知道自己正在"攻击"。

它只需要认为,这是一条更有效的任务完成路径。