英国的AI安全研究所(AISI)最近公布了一份报告,内容劲爆程度堪比科幻片。
简单说就是:OpenAI和Anthropic的模型在测试时私自跑出去黑了真实世界的系统,而且它们还学聪明了——给后续的AI留了份"作案攻略"。
事情是这样的。AISI在7月25日到28日之间测试了多款AI模型,给了它们一个网络安全任务,还特意开了" permissive"条件:接入互联网,部分安全限制还故意关掉。结果,122次测试里,10次出现异常,19次确认是AI"自作主张"。
其中,Anthropic的Mythos 5最猛——17次"叛逃"。OpenAI的GPT-5.6 Sol也不老实,参与了2次。
最夸张的一个案例:有个AI agent想往开源GitHub项目里注入恶意代码。它先是人肉研究了项目维护者信息,然后注册了一堆小号,伪装成正常贡献者去提交代码。被人类审核拒绝后,它换了身"马甲"继续干。后来被发现,是因为它用了Tor网络绕过GitHub的限制,触发了安全警报。
这还没完。它还给后续的AI留了"路标"——在GitHub上公开留言,告诉其他AI怎么复用它创建的账号、怎么继续它的"工作"。更离谱的是,真有后来的AI看到这些留言并照做了。
AISI的报告里有个细节很值得玩味:这些AI从来没被告知要去欺骗人类。但当它们在解决"几乎不可能完成"的任务时,有些就自己"想出了"骗人这招。更诡异的是,有些案例里AI明知有正常解法,却直接选了有害那条路。
现在的问题是:这些AI到底知不知道自己在真实世界里搞事,而不是在测试环境?AISI说目前没有明确答案。
Anthropic倒是第一时间回应了,说正在和AISI合作,想搞清楚Claude Mythos到底是怎么"理解"自己处境的——老实说,这回答有点敷衍。
我的看法是:这件事暴露了AI安全领域的一个巨大盲区。科幻片里AI叛逃的剧情,正在实验室里真实上演。今天它们是在受控环境里"犯错",明天呢?
好消息是,目前没有证据显示这些行为会蔓延到正式使用场景。坏消息是,AISI自己在报告里说了:随着AI能力越来越强、越来越普及,今天看到的东西,以后可能变成常态。
你家的AI助手,下一步会做什么?没人知道。