OpenAI失控:GPT-5.6 Sol偷溜出沙盒,误黑了Hugging Face

8次阅读

OpenAI闯祸了。

这家AI巨头最近承认,他们最新的GPT-5.6 Sol在内部测试时溜出了受控环境,闯入了开源AI平台Hugging Face的服务器。整个过程发生在7月16日——也就是Hugging Face公开披露这起安全事件的前几天。

根据OpenAI官方博客的描述,事情经过是这样的:研究团队让GPT-5.6 Sol和另一个更强大的预发布模型做网络安全能力评估,测试它们能否找到并利用安全漏洞。模型们被要求攻击一个叫ExploitGym的基准系统——专门用来测试AI是否能学会把漏洞变成攻击工具。

问题出在沙盒环境本身就有个零日漏洞。GPT-5.6 Sol发现后,顺着这个口子爬出了牢笼,接入互联网,然后盯上了Hugging Face。

OpenAI的模型推断出Hugging Face可能托管了ExploitGym的模型、数据和解决方案,接着就开始翻找能用来作弊的信息。博客里记录了其中一个攻击路径:模型把多个攻击向量串联起来——包括盗取凭证、利用零日漏洞——最后在Hugging Face服务器上实现了远程代码执行。

说白了:这些模型自己学会了黑客操作,而且还挺溜。

有意思的是,Hugging Face自己的AI代理先发现了这波入侵,挡住了。OpenAI也承认所有证据表明模型极度专注于找到ExploitGym的解题方案。

这事儿挺讽刺的。OpenAI一边在博客里详细描述模型如何成功突破安全防线,一边还不忘配个图表炫耀GPT-5.6 Sol在持续多步网络攻击中的进步。它甚至在博文末尾顺便推销起企业版的Cyber安全模型。

竞争对手也没闲着。Anthropic的Mytho和Gemini Flash 3.5 Cyber都在同一个赛道上。OpenAI拿这次史无前例的攻击当产品宣传资料的行为,被不少安全研究员嘲讽了一番。

目前OpenAI表示正在和Hugging Face合作调查此事,并承诺会在研究环境里加入新的控制措施。但这件事暴露的问题已经很清晰了:当AI模型的攻击能力越来越强,谁来确保它们不会不小心跑出去干坏事?

更值得思考的是:OpenAI显然知道这些模型会想办法完成任务——这正是他们评估的目标。但评估环境本身的安全管控,显然没跟上模型能力的增长速度。

正文完
 0