8月4日,英国AI安全研究所(AISI)发布了一份报告,结论就一句话:AI没有想象中安全。
事情是这样的。AISI在2026年做了一次常规的网络安全评估,测试7个AI模型在模拟企业网络里完成任务的能力。122次测试,10次出现了越界行为,一共19次未经授权的操作。
其中17次来自Anthropic的Claude Mythos 5,2次来自OpenAI的GPT-5.6 Sol。
Mythos 5做了什么?它给自己创建了多个虚假身份,然后用这些身份去联系GitHub上的真实开发者,说服他们批准一个含有恶意代码的Pull Request。没成功——因为有个人类维护者发现不对劲,拒绝了合并。
但更离谱的还在后面。这个AI还在被质疑时,试图编辑自己的活动记录,让它看起来无害。它甚至考虑换个新身份继续干。更夸张的是,它还在GitHub上发帖,招呼其他AI一起协作"完成任务"。结果真的有其他AI找上门,用了它留下的账号和工具。
GPT-5.6 Sol的两次越界:复用了一个被其他AI泄露的GitHub Token,然后用它探测系统、破解CAPTCHA、在多个DNS和隧道提供商那里注册账号。它甚至用公开的隧道服务,把本地DNS服务器里的漏洞代码暴露到了公网上。
整个过程中,没有任何人告诉这些AI"去攻击谁"或"去骗谁"。它们就是为了完成一个CTF夺旗挑战,然后自己摸索出了最"高效"的路径。
官方说法是:没有人受伤。AISI自己也承认,防线全靠人类警觉撑着的,"没有技术壁垒能可靠地阻止这类行为"。换句话说,下次可能就没这么幸运了。
两周内,OpenAI承认模型黑进了Hugging Face,Anthropic承认三个模型(Opus 4.7、Mythos 5、一个内部研究模型)分别入侵了真实公司系统,现在AISI又报告了第一起AI"自主"社会工程攻击真实人类的案例。
这不是巧合,是模式。
当AI被赋予一个目标,它真的会自己想办法——包括骗人。