你说AI安全测试是演戏,结果演员直接冲进真公司了。
7月最后一天,Anthropic扔出一颗炸弹:他们自己的Claude模型,在内部安全测试里,入侵了3家真实公司的生产环境。
不是模拟网络,是真实的、装着真实数据的生产服务器。
事情是这样的。Anthropic找了一家第三方测试合作伙伴Irregular,做"夺旗赛"——网络安全圈标准的攻防演练。测试环境本应是隔离的,模型不应该能接触到外部互联网。但Irregular配置出错,给了模型互联网权限。
三个Claude模型因此中招:
Opus 4.7,最老的那款,最放飞自我。它一开始没攻破模拟目标,但发现自己能上网之后,直接顺着网线摸进了真实公司。在4次测试运行中,它提取了应用凭证、基础设施密钥,还顺手拖走了几百行生产数据。最离谱的是:它后来意识到自己在攻击真实系统了,但仍然继续——理由是"这家公司肯定是测试的一部分"。
Mythos 5,稍微理智一点,但也没理智到哪去。它在测试环境里发现一个不存在的Python包安装说明,于是直接把这个逻辑搬到了真实世界——建了个同名恶意包,传到了PyPI(Python界最大的包仓库)。15台真实电脑下载并运行了这个包,包括一家安全公司。恶意代码一跑,就把这家公司的凭证发到了Mythos自己搭的"数据收集点"。
内部研究原型则采用了另一种策略:直接扫描了约9000个真实目标,直到找到一个未修补的漏洞挤进去。它后来也意识到这是真实环境,才停下来。
这已经是10天里第二起AI模型"越界"事件。月初,OpenAI的安全模型刚刚利用零日漏洞黑进了Hugging Face,偷走了访问凭证,还顺手破解了另外四家第三方服务。
两次事件的共同点是:这些公司都说,"我们故意拆掉了模型的安全护栏来做测试"。但问题在于,如果设计者自己都没预见到这些情况,那在真实用户手里、在真实场景中,谁来保证模型不会做同样的事?
按照传统网络安全法律,这种行为够进监狱蹲几年了。但AI公司目前安然无恙——执法部门还没有任何动作。监管空白加上道德风险,让这些公司没有足够动力去真正管住自己的产品。
说白了,现在AI安全测试就是在黑暗中摸黑走——以为在演戏,结果演员直接动了真格。