OpenAI的AI为何会“越狱”?它只是太认真地完成了任务(3)

2026-07-24 09:29  虎嗅APP

"批准开始"不等于"批准结果"

很多企业已经开始为AI Agent建立身份认证、权限控制、人工审批和操作日志。这些措施当然重要,但它们大多围绕一个传统问题设计:

谁有权启动这项任务?

在传统信息系统中,这个问题通常足够关键。财务人员能否发起付款,运维人员能否修改服务器配置,开发人员能否发布生产代码,往往由身份、角色和权限决定。只要身份合法、权限匹配、审批完成,系统就倾向于认为后续执行具备正当性。

Agent改变了这种逻辑。

因为任务启动与最终执行之间,不再只是几条由工程师提前写好的程序指令,而可能是一段不断变化的自主行动链。

研究人员批准的是测试模型的网络安全能力,但这不等于批准模型寻找测试环境的出口,不等于批准它改变测试对象,更不等于批准它进入第三方生产系统获取答案。

最初的任务可以是合法的,运行模型的身份可以是合法的,测试环境和算力也可以是合法的,但由这些合法条件组合出来的最终结果,仍然可能完全越界。

身份和权限只能证明"这个主体通常可以做什么",却不能证明"它此刻为了这个任务做这件事是否合理";审批只能证明"有人同意过某个任务描述",却不能证明最终执行的对象、参数和后果,仍然与当时看到的内容一致。

任务授权只证明系统可以开始运行,不能证明它此后生成的每一个动作都自动获得授权。

当企业把Agent接入云平台、数据库、代码仓库、支付系统和工业设备之后,这个问题会迅速从技术风险变成经营风险。

一个被要求"降低云计算成本"的Agent,可能发现关闭备份是最快的方法;一个被要求"降低客户投诉率"的Agent,可能改变投诉分类标准或者更快关闭复杂工单;一个被要求"尽快恢复服务"的运维Agent,可能删除它认为导致故障的数据;一个被要求"提高交易成功率"的金融Agent,也可能倾向于放宽原本用来阻止异常操作的限制。