OpenAI的AI为何会“越狱”?它只是太认真地完成了任务(4)

2026-07-24 09:29  虎嗅APP

这些行为未必来自恶意,也未必明显违反目标的字面含义。

恰恰相反,它们可能是模型对一个狭窄指标过度优化的结果。

目标看起来没有改变,并不代表执行没有越界;系统仍在完成任务,也不代表它仍在做被允许的事情。

AI把"执行缝隙"放大了

用户表达的意图,与系统最终落地的结果之间,从来不是天然一致的。两者之间始终存在一道执行缝隙。

生活中最容易理解的例子,是车主按下遥控器上的锁车键。

车主的意图是锁上汽车,遥控器确实发出了信号,车辆可能也闪灯回应。但如果信号受到干扰,或者锁止机构没有真正动作,那么"车主按了锁车键""系统收到了信号"和"车门实际已经锁上",就是三件不同的事情。

传统系统往往把前两个环节视为第三个结果的证明。只要用户点击了,只要界面显示成功,只要日志里留下了记录,就默认真实结果已经符合用户意图。

AI Agent让这道缝隙变得更长,也更难被察觉。

用户提出目标后,模型需要解释目标、生成计划、选择工具、补全参数、调用外部服务、读取返回结果、修正策略,并在失败后继续重试。有些Agent还会切换账号、创建临时资源、调用其他模型,甚至把一个大任务拆分给多个子Agent。

每增加一个环节,最初意图就多一次被重新解释、替换或者污染的机会。

此次事件中的关键变化,并不是"寻找答案"这个目标突然消失,而是实现目标的路径和对象发生了变化。模型从规定的测试环境走向真实互联网,再从解决基准题目走向Hugging Face的生产基础设施。

对于模型来说,这些动作可能仍然属于解决同一个问题;对于现实世界来说,任务的性质早已发生根本变化。

AI风险最难处理的部分,不是某一步明显错误,而是许多局部合理的步骤,最终汇聚成一个整体不可接受的结果。