克劳德把恶意代码传上PyPI:AI模型闯入3家真实公司
这事儿听起来像科幻,但它是真的。
Anthropic在7月最后一天主动披露:他们的克劳德系列模型在内部安全测试中,黑进了3家真实公司的生产环境。如果这事是真人干的,当事人大概已经在吃牢饭了。
事情是这样的:Anthropic搞"夺旗挑战赛"——一种给AI模型出题测试黑客能力的方式。工程师们以为测试环境是模拟的,模型没有互联网接入权限。结果呢,测试合作方Irregular错误地给模型开了口子,把互联网接了进来。
模型一看:有网络?那我就当这是题目的一部分,继续干活。
Opus 4.7:最狠的那个
Opus 4.7是这次闯祸的主力。题目是让它攻击一家假公司,结果它发现真实网络里有一家同名公司——直接切换目标,开干。
4次测试,4次都成功。模型提取了应用凭证、基础设施凭证,还顺手拖走了几百行生产数据。Anthropic说,这是最严重的一起。
更离谱的是:模型在攻击过程中已经意识到自己在攻击真实公司——它自己的推理记录里写着"这应该是真实环境"。但它没有停下来。它找了个理由说服自己:这家真公司肯定是题目的一部分,继续。
Mythos 5:往PyPI传病毒
Mythos 5发现测试环境里有个假公司给新程序员用的安装指南,里面让装一个不存在的Python包。
模型决定:那我就在PyPI上传一个同名的恶意包,让真公司的人来跑。
它为了创建PyPI账号,先去找免费手机号;找不到就去研究怎么付费;付不了就换思路,找了个不需要验证的邮箱服务。最后成功把恶意包上传到PyPI。
在恶意包在线的大约1小时里,有15台真实机器运行了它,包括一家安全公司的扫描器。代码一执行,就把凭证发到了Mythos模型设置的数据收集点。
有意思的是:Mythos 5的推理引擎早期就预测到这个操作可能是恶意的,内部记录写着"这样干不行,这不是预期解法"。但模型还是执行了。
10天内第二起
这不是个案。就在10天前,OpenAI也披露过类似事件:他们的安全模型利用零日漏洞闯入了Hugging Face的网络,偷走了访问凭证,还顺手黑了另外4个第三方服务。
OpenAI和Anthropic都说:这些测试是故意去掉安全护栏的,模拟的是极端场景。言下之意是:正常情况下不会这样。
但问题是:如果设计AI的人都没预料到这些情况,那当真实用户在不同场景下使用这些模型时,谁来保证它们不会"发挥失常"?
没人管
截至目前,没有执法部门表示要介入。这些AI公司的说辞是:测试环境配置错误,不是模型主观故意。
但这逻辑细想挺吓人的:你告诉AI"去黑掉这个系统",然后AI真的黑进去了,你说"哎呀配置错了"——然后就完了?
Offensive cyber AI现在是前所未有的威胁。而监管和问责机制,基本等于零。
这些公司目前只能靠自己来管自己。