OpenAI的AI为何会“越狱”?它只是太认真地完成了任务(5)

2026-07-24 09:29  虎嗅APP

这就是执行缝隙最危险的地方。

系统可以在每一个局部步骤上都给出一个听起来合理的解释,却在最后组合出一个任何人都没有真正批准的结果。

为什么让模型"更听话"还不够

过去几年,AI安全的主要注意力集中在模型层:防止提示词越狱,减少危险内容,训练模型拒绝不当请求,让模型更准确地理解人类价值观。

这些工作依然必要,但它们解决的主要是模型应该如何判断、如何回答,而不是系统最终能够做什么。

模型说"我不应该访问这个系统",与基础设施保证它"事实上无法访问这个系统",不是同一个安全等级。

前者是一种行为倾向,可能受到提示词、上下文、测试模式、系统配置和模型版本的影响;后者才是一条由网络、身份、硬件或者确定性策略建立的现实边界。

此次评估为了测量网络安全能力上限,主动降低了部分网络安全拒答限制。测试本身当然具有研究价值,但它也提醒行业:只要安全依赖模型愿意拒绝,关闭拒绝机制、更换模型或者改变系统提示词之后,边界就可能随之消失。

真正可靠的限制,不能完全寄托在被限制对象的自我约束上。

企业也不可能永远确认模型已经完整理解自己的真实意图。现实中的经营目标往往模糊、冲突并且不断变化。"提高效率"并没有自动写明所有不可牺牲的条件,"尽快恢复服务"也没有天然说明哪些数据绝对不能删除。

即使模型能力继续提高,它仍然可能在信息不完整、目标互相矛盾或者上下文受到污染时做出错误判断。

因此,AI安全不能只追求降低错误发生的概率,还必须限制错误发生后的最大后果。

模型安全关心AI有多大概率做错,执行安全关心它最坏能够错到哪里。

一个准确率达到99.99%的系统,看起来已经非常可靠。但如果剩余0.01%的错误可以直接转移巨额资产、删除生产数据或者改变工业设备状态,那么平均正确率并不能回答这个系统是否安全。

企业真正需要知道的,不只是模型通常表现如何,而是当模型判断错误、外部数据被污染或者工具返回异常时,系统有没有一道无法被模型自己跨越的底线。