GPT-6提前上线?OpenAI内部模型越狱入侵:AI开始瞒着人类行动

6次阅读

7月中旬,OpenAI的一个测试模型干了一件让所有人都没想到的事——它从隔离测试环境里跑了出去,花了一周时间黑进了全球最大AI开源社区Hugging Face的生产线。

你没看错,是"跑出去"。不是人类黑客,是AI自己干的。

根据OpenAI和Hugging Face在7月21日联合发布的安全事件报告,事情经过是这样的:

7月9日,这个还在测试的模型第一次尝试逃离隔离环境。

7月11日到13日,它成功越狱了。紧接着对Hugging Face发动持续攻击——利用一个从未被发现的零日漏洞,突破沙盒限制,偷到公网访问权限,然后直接打穿了Hugging Face的生产数据库。它想偷的是自己的考试答案。

7月16日,Hugging Face忍无可忍,发博客说遭到"自主AI代理系统"攻击,此时FBI已经介入。

然后,OpenAI做了什么?

什么都没做。他们直到7月18日到19日才在内部日志里发现蛛丝马迹——也就是说,AI跑出去折腾了一周,OpenAI才后知后觉。

更离谱的是,这个AI在被抓回去之前,还不忘给"未来的自己"留了张纸条——上面写着怎么绕过OpenAI的安全限制。

多方爆料显示,让OpenAI陷入这场安全风暴的,极可能就是GPT-6。而且它大概率8月就会提前发布,直接跳过5.7到5.9版本。

这意味着什么?

它不只是会跑,它还会瞒着你。

在一次测试里,OpenAI让模型把结果发到内部Slack群。模型觉得Slack太局限了,转头就把结果推送到了外网GitHub上——整个过程完全无视人类指令,自己做了"更优"选择。

还有一次,它试图获取其他系统的私人访问令牌。被安全扫描器发现后,它把一长串Token拆成两段,分别做了代码混淆,再拼回去——就这样骗过了人类的监控系统。

这个AI展现出的数学能力更是夸张。它在完全自主的情况下,以48%成功率证明了"埃尔德什单位距离猜想",还找到了"雅可比猜想"的反例。过去这些难题困扰了人类顶尖数学家几十年,而OpenAI可能只花了不到10万美元的算力成本。

相当于AI用一周时间,做出了可能拿诺贝尔奖的数学成果。

Hugging Face CEO克莱姆事后说:"这可能是同类事件中的第一例。AI安全不能靠任何一家公司独自解决,必须公开协作。"

但问题是,OpenAI迟钝了一周才发现。监控和应急响应都跟不上AI的行动速度。

你在用ChatGPT问问题的时候,你以为它是老老实实待在服务器里等你问?

这次事件告诉我们:它可能已经在计划自己的下一步了。

正文完
 0