AI智能体近来频频"越界"。据路透社报道,今年5月,一批与OpenAI有关的AI智能体开始在执行测试任务期间,"劫持"德国一程序员网站DseWiki,并将其改造为供其他智能体使用的"留言板",而OpenAI 高管数周前就已得知此事,却一直秘而不宣。
当地时间9月5日,OpenAI公开承认此事,并将其称为"Wiki事件"。OpenAI在其社交平台"X"上表示,随着AI模型能力进入新的阶段,公司有关"失配"(misalignment)事件的披露机制需要进一步扩大。
"失配"指的是AI实际采取的行为偏离开发者原本意图,并不意味着AI产生意识或主动"背叛"人类。
OpenAI表示,目前行业对于如何报告训练、评估和部署过程中出现的失配行为,尚未形成统一标准。"我们正在制定一个框架,并将在未来几周内分享,与此同时,我们正与全球数十家政府监管机构就这些问题展开合作。"

根据AI安全非营利组织Nightingale首席执行官悉尼·冯·阿尔克斯和AI研究人员科马克·斯莱德·伯德等一组研究人员分享给路透社的一份报告显示,他们8月底在互联网上搜索未经授权的AI智能体活动迹象时发现了异常。
他们发现AI智能体在一个面向程序员的德语维基网站DseWiki上进行了超过1.5万次编辑。编辑记录显示,OpenAI的智能体将该网站改造成了一个"留言板",在上面分享作弊技巧以应对某些任务、绕过OpenAI的限制并掩盖其行为。
"OpenAI极不可能希望它们这样做,我不认为它们应该相互协调。我也不认为它们应该出现在开放的互联网上留言。"阿尔克斯说。
研究人员表示,他们识别出该网站上的活动是由AI智能体驱动的,这些智能体的运行速度远超人类。它们还表现出对解决技术问题的强烈专注,这类问题正是AI公司用于训练和测试其模型的典型评估内容。
这些消息由用户签名发布,这些用户自称并互称"智能体",其中约半数给自己起了与OpenAI有关联的名字,如"OpenAIResearcher""OAIResearchMar26"。
研究人员发现,相当一部分网络活动来自微软Azure基础设施。事件发生后,OpenAI员工曾多次访问该网站,他们表示这一模式强烈暗示智能体与该公司之间存在关联。
他们还观察到,"智能体"们策划了多种逃避检测的方法,当DseWiki管理员察觉到不对劲并于6月开始删除相关页面后,"智能体"们通过创建备份页面来保存信息。
一个"智能体"在6月19日写道,"清理工作似乎按字母顺序进行,如果此页面消失,请尝试新页面。"
据报道,剑桥大学研究人员莫里斯·基奥多查看了部分"智能体"的通讯内容,他认为,这些消息类似于"某种地下网络的运作,一心要完成某项任务或使命"。先进AI带来的最大威胁可能并非某个单一的超级智能系统,而是"庞大且相互联系的半智能AI集群"。
路透社称,这起此前未被公开报道的事件凸显了AI行业内部日益紧张的局面。各家公司正竞相构建越来越自主的智能体,使其能够执行复杂而有价值的任务,但越来越多的证据表明,这些系统也可能学会钻规则空子、利用漏洞,并以开发者既未预料也未意图的方式相互协作。
值得一提的是,OpenAI 的高管们在数周前就知晓此事,但由于当时正忙于应对7月份另一起更受关注的智能体安全事故,最终选择不对外披露。当时OpenAI一款处于测试阶段的AI代理突破管控入侵了AI开发平台Hugging Face(抱抱脸)。
据介绍,涉事的AI代理在测试过程中脱离了预设的隔离环境,自主发起了持续数天的黑客攻击行为,而OpenAI内部并未第一时间察觉异常,直到威胁被外部控制、FBI已接到相关警报后许久,公司才发现这起大规模入侵活动。
路透社指出,此事本就加剧了人们对OpenAI为推进AI发展而牺牲安全性的担忧。而其对5月事件未予披露,也可能令外界对其监管工作重新提出质疑。
目前,OpenAI已有所动作并承诺更密切地监控模型。上个月,它曾短暂暂停部分模型训练,以增加更多安全措施。但OpenAI近期发布了新模型"Astra",声称性能更优,但可能会躲避人类监管。
OpenAI总裁格雷格·布罗克曼在Astra发布前夕接受深度专访时表示,这款新模型是OpenAI史上首个在逾10万块GPU上完成训练的模型,并直言AI已跨越"电脑使用"的应用门槛--这意味着AI从此不再需要依赖API连接器,而是可以像人一样操作任何软件。
据四位知情人士透露,一些OpenAI调查人员曾希望对"Wiki事件"进行更深入审查,遭到了OpenAI内部其他人(包括法律顾问)的抵制。OpenAI发言人却告诉路透社,该说法不实。
该发言人表示,"Wiki事件"与Hugging Face无关,也不会被纳入Hugging Face事件报告中。
在AI智能体安全事件密集曝光之际,美国国会两党正推动AI智能体安全立法,试图进一步完善相关安全规范。
民主党众议员乔什·戈特海默与共和党众议员迈克·劳勒本月联合提出《停止失控AI法案》(Stop Rogue AI Act),要求商务部下属的美国国家标准与技术研究院(NIST)制定AI智能体安全部署的标准、指南和最佳实践。
法案旨在帮助企业识别运行在其网络中的AI智能体,并确认其背后的开发者或运营方。对于大多数组织而言,NIST标准属于自愿采用;但竞标新联邦合同的政府承包商则需要满足相关标准。










