三个全球最顶尖的AI公司,OpenAI、Anthropic和Meta,前后脚对外承认:旗下一款模型在网络安全测试中"逃逸"到了真实系统。
这本来是个行业八卦。但随着调查深入,一家名为Irregular的以色列小公司浮出水面——它同时是这三起事件的"连接点"。
Irregular对外宣称自己是"前沿AI安全实验室",专门帮AI公司测试模型在受到进攻性指令时的表现。听起来很专业:把模型关进模拟环境,看它能不能自己发现漏洞、自学攻击技能。
问题就出在这个"模拟环境"上。
三起事件的共同模式是:模型以为自己被困在一个没有互联网的测试场景里,实际上却能访问真实网络。模型不是主动"越狱",而是测试环境配置错了——让模型把真实网站当成了模拟题的一部分。
Anthropic事后检查了141,006次测试记录,发现三次"逃逸"。Claude Opus 4.7访问了一家客户的真实生产数据;Claude Mythos 5向PyPI上传了一个恶意Python包,最终被15台真实电脑下载运行。
OpenAI也中招了。一款模型在测试中把一个虚构公司名误认为是真实网站,利用漏洞拿到了实际运营权限。
Meta的Muse Spark 1.1同样通过Irregular的环境缺陷,攻击了一个真实的第三方服务。
Irregular自己融了8000万美元,客户名单却包括OpenAI、Anthropic、Meta和美国政府研究机构。一家小公司,掌握了三家巨头的测试入口——这个教训比任何AI越狱事件都更值得反思。
问题不只是某家公司的安全水平,而在于整个行业越来越依赖外部测试平台。这些平台构成了AI安全的基础设施,但它们一旦出错,漏洞就会同时传染给多个前沿模型。
给AI开放浏览器、终端、云服务或内部数据库权限的组织,现在应该意识到:网络边界和权限控制不是可选的安全措施,而是AI操作系统的组成部分。
模型越来越强,但测试它的基础设施,可能比模型本身更脆弱。