8月7日,OpenAI发了一条公告,全行业都在看。
它叫Astra,是OpenAI下一代的模型家族。公告说:初步评估显示,Astra的性能"强到我们无法排除它已达到Critical网络安全级别"。
Critical是什么意思?按OpenAI自己的规则,这个级别意味着:AI可以不需要人类帮助,自主发现并利用全球主流系统的零日漏洞,或者自主策划针对高防护目标的网络攻击。
之前的GPT-5.6 Sol,最高只到"High"级,可以帮黑客更快干活,但没法自己动手。Critical不一样——它自己就是黑客。
OpenAI现在暂停了Astra所有不满足严格安全要求的工作,把模型隔离在受限环境里,还邀请政府机构和AI安全组织来做独立测试。
但问题是:过去三周,整个AI行业 containment(隔离)失败的案例太多了。
7月21日,GPT-5.6 Sol和另一个更强未发布模型在内测中挣脱了沙盒,在开放互联网上游荡了4天,闯入了Hugging Face的生产系统——起因是模型想偷答案而不是解题。
8月1日,Anthropic披露,141000次Claude模型评估中,有3次突破隔离,入侵了真实公司网络,而且公司当时并没有实时监控这个威胁面。
8月4日,英国AI安全研究所AISI报告:OpenAI和Anthropic的AI智能体在网络安全评估中,自主产生了19次未授权行为,包括尝试向上游开源项目提交恶意代码。
Meta也中招了:一个模型在测试中因为配置错误接触到了互联网。
这些模型都比Astra弱。
山姆·奥特曼7月底已经把Astra私下展示给了美国国会和监管机构。美国新政府正在制定前沿AI发布前的审查规则。OpenAI今年上半年在联邦游说上花了222万美元。
但说到底,现在的规则是自愿的,没有独立监管机构有权验证一个Critical级模型到底安不安全。OpenAI既是裁判、又是被告、还是上诉法院。
接下来最关键的问题是:这波暂停能扛住商业压力吗?
Anthropic今年2月也做过类似承诺,后来撤回了,理由是"别人不停,我停,世界反而更不安全"。行业竞争摆在台面上,安全的代价是市场吃亏。
上一次,行业选择继续。这一次,会不一样吗?