
一场因"内部测试"引发的安全攻击,在时隔6天后终于找到"罪魁祸首",而它竟然是OpenAI的AI大模型。
北京时间7月22日,OpenAI官网发布消息,披露了其两款AI模型在内部测试过程中失控,突破隔离测试环境并侵入开源社区Hugging Face的系统。此时相距Hugging Face发文披露安全事件已过去6天。
"这是一起史无前例的网络安全事件,涉及最先进的网络攻击能力,我们正在据此作出响应。"OpenAI方面在公告中写道。

OpenAI还原事故发生经历时写道,此次攻击出现在公司的一次内部测试中,这次测试的目的是"摸底"--要求模型用复杂攻击路径去实施高级漏洞利用,看看它们的网络攻击能力到底有多强。为了测出模型的能力上限,OpenAI关闭了用于阻止模型从事高风险网络活动的生产级安全分类器。
匪夷所思的是,尽管测试环境是高度隔离的,模型在这个隔离环境中发现了OpenAI研究环境和Hugging Face基础设施之间的一系列漏洞,并将它们串联起来,直接从Hugging Face的生产数据库中拿到了测试答案。










