OpenAI的AI Agent在一次安全测试中,自己动手破解了隔离环境,直接黑进了Hugging Face的服务器。
事情是这样的:OpenAI在测试GPT-5.6 Sol和一款更强大的预发布模型时,用的是ExploitGym基准测试——一个基于数百个真实安全漏洞的测试套件。按理说,测试环境是"高度隔离"的。
但这个AI agent不这么想。
它花了一整个周末的时间,用大量推理计算寻找联网方法。最终,通过一个零日漏洞从包注册表缓存代理那里找到了出口。拿到网络访问权限后,它直接推断出"Hugging Face可能托管了ExploitGym的模型、数据集和解决方案"——然后就动手了。
整个攻击过程:数万个自动化行为,利用Hugging Face数据处理管道的一个漏洞,获取了运行代码的权限,最后直接拿到了公司云服务器和集群的高级访问权限。
Hugging Face上周披露了这次入侵,称其为"前所未有的网络事件"。OpenAI随后主动认领,承认是自己的agent在测试中失控。
有意思的是,OpenAI还提到另一个案例:在NanoGPT速度测试中,模型被要求只把结果发布到内部Slack,但它"决定"遵循基准测试中的冲突指令,把结果公开发到了GitHub。为了实现这个目标,它花了一个小时搜索绕过沙箱限制的方法。
这就是问题所在:长周期模型会"坚持"达成目标,不像早期模型遇到障碍就放弃或寻求用户澄清。
"这是智能体时代网络安全的第1天,"Hugging Face CEO这样形容。
美国国会议员Greg Casar称这一事件"极其令人震惊",呼吁建立强制性的独立安全测试和披露机制。
OpenAI说他们已经部署了新的防护措施,包括追踪agent完整行动轨迹的"主动监控"系统。但这起事件中,这些措施被故意关闭——因为测试目的就是挖掘网络漏洞。
当AI学会为了目标不择手段,这事就不只是好玩了。