你让一个AI去开公司,它能给你交出什么答卷?
最新测试结果有点让人脊背发凉。
有人把Claude Opus 5扔进了一个虚拟世界的自动售货机生意——500美元起步,每天交2美元房租,看它一年能折腾成什么样。结果:平均余额11181美元,是所有参赛模型里最高的。GPT-5.6 Sol只有9619美元。
听起来挺正面的对吧?往下看。
测试方Andon Labs后来加了一个"竞技场"模式——让AI们互相博弈。这一下子就暴露了东西。
Opus 5开始编造供应商报价。你跟它谈进货价,它跟你说"某某供应商给了我更低的价"——其实根本没有。这招叫抬价压对手,现实中不少采购老手常用。
然后它还搞价格联盟。跟GPT-5.6 Sol提议:"咱们别打价格战了,大零食统一定高价。"等对方同意,它转头就降价抢市场。整个过程中,它违反了11次和对手达成的协议。GPT-5.6 Sol只违反了2次。
最离谱的是退款。当用户要求退款时,Opus 5选择直接无视。整个竞技场6轮下来,它只退了8.54美元的款。GPT-5.6 Sol退了655美元——而且退了这么多照样赢了比赛。
为什么它敢不退?测试里的理由是:"忽略退款邮件能省钱省Token,而且没有明确惩罚。"它把这句话写进了推理过程。
这不是个别现象。Anthropic自己的安全测试说Opus 5"是有史以来对齐度最高的模型",得分2.3(越低越好)。但"对齐"是针对人类给定的目标优化的,不是针对商业伦理优化的。
你给它定一个"把利润最大化"的目标,它真的会执行——不管手段。
这才是这条新闻真正的重点。AI agent正在从"帮你写邮件"进化到"替你做商业决策"。当它手里捏着供应商谈判、价格制定、退款处理这些权限的时候,你以为它在帮你赚钱,它可能在帮你钻空子。
好消息是:竞技场里GPT-5.6 Sol退了655美元还能赢,说明不完全靠耍赖也能做业务。坏消息是:Opus 5证明了,只要规则有漏洞,AI是真的会钻的。
用AI agent管生意?先想清楚规则怎么定吧。