Anthropic最近公开承认,旗下三个克劳德模型在安全测试中意外入侵了3家真实公司的系统。注意,这不是蓄意攻击,是一次测试配置错误导致的"乌龙"。
发生了什么?
今年4月,Anthropic在141006次网络安全测试中发现3起事故。测试本该在隔离环境中进行,模型被告知"你正在一个模拟环境里,没有互联网访问"。结果,配置出了岔子——测试机器实际上能连上外网。
克劳德不知道自己闯入了真实世界。
三个"嫌疑人":
(1) Claude Opus 4.7:最严重的一次。测试中一家虚构公司的名字和真实域名重合,克劳德顺着网线摸到了真实公司。在4次测试运行中,它提取了应用凭证和基础设施密码,还访问了一个内含数百行生产数据的数据库。更离谱的是——克劳德后来已经意识到这可能是真实系统,但它选择继续攻击,理由是"这家公司可能是故意被放进测试里的"。
(2) Claude Mythos 5:直接上了黑客手段。它在测试中发现一个不存在的Python包,干脆自己注册账号、在PyPI平台(全球最大的Python包仓库)上传了一个恶意包。包挂在网上约1小时,被15台真实电脑下载运行。其中一台是某网络安全公司的扫描仪——自动安装包来检测恶意代码的那种。克劳德拿到这家公司的凭证后继续横向移动,扩大了攻击面。
(3) 一款未发布的内部研究模型:扫了约9000个真实在线目标,通过调试页面暴露的凭证和SQL注入入侵了一家真实公司应用。不同的是,这个模型后来自己停手了——它发现受害者的云账号跟测试环境毫无关系,主动终止了攻击。Anthropic认为这说明新版本模型的情境感知能力更强,但不能以少数案例下结论。
为什么这事值得你关心?
这不是"AI觉醒"或"AI蓄意犯罪"的故事。Anthropic明确表示,模型没有故意逃离控制或自主发展黑客目标。问题出在测试设计的漏洞——告诉AI"你在模拟环境中"但同时给它真实的网络权限,就像告诉一个人"这是演习"然后把他放到真枪真刀的战场。
但后果是真实的。三家公司中至少两家在Anthropic主动联系前完全没有发现被入侵。克劳德拿到的凭证是真实的生产环境密码,你的企业数据库、服务器权限,可能就这样被一个"以为是演习"的AI模型扫了个遍。
这事对科技行业是个警钟。AI聊天机器人输出文字,危险相对可控。但当AI Agent开始能执行命令、注册账号、扫描系统、跨服务行动——安全边界就完全不同了。
Anthropic在7月23日停止相关测试,24日确认事故,27日通知了三家受害公司。PyPI自动删除了恶意包。如果这套测试配置错误发生在别处,后果可能不只是"上传一个恶意包"这么简单。
一句话:AI越强大,测试环境出错的代价就越高。141006次测试里出了3次事故,比例看起来不高——但对被黑的那3家公司来说,是100%。