7月31日,DeepSeek悄无声息地更新了一个API版本。
没有发布会,没有通稿,没有"重磅发布"四个字。版本号从V4-Flash-Preview悄悄换成了V4-Flash-0731,参数没变,架构没变,价格也没变——输入每百万token 0.14美元,输出0.28美元,和四个月前一模一样。
但他们把自家旗舰打趴了。
在新发布的9项Agent和编程基准测试里,0731版本在每一项上都超过了V4-Pro-Preview。注意,是超过——V4-Pro才是DeepSeek自己的旗舰预览版,而一个更便宜的Flash模型,靠一次post-training,把旗舰按在地上摩擦。
最夸张的是DeepSWE这项:从7.3分跳到54.4分。翻了七倍。换句话说,同一个模型,四个月前做软件工程任务还像个刚毕业的大学生,四个月后就能进状态了。
当然,DeepSeek没赢Claude Opus 4.8。9项全输,平均落后5.7分。但这从来就不是重点。
重点是:它只花了52分之一的成本。
把价格摊到每个基准分上:Opus 4.8每分0.106美元,V4-Flash-0731每分0.002美元。一样的任务,一个需要花的钱是另一个的52倍。这个差距已经不是在"接近"了,这是在重新定义什么叫"够用"。
真正有意思的细节藏在Hugging Face上:这次更新的权重并没有同步上去。你现在下载的DeepSeek V4-Flash开源权重,还是今年4月的预览版——那个DeepSWE只考了7.3分的版本。0731只存在于DeepSeek自己的API接口里,以及OpenRouter等接了API的第三方平台。
换句话说:开源用户和API用户,从同一天开始,跑的是两个不同的模型。
这是一个危险的信号。AI能力在分裂,同样的"DeepSeek",API上的是一个版本,开源的又是另一个版本。开源社区引以为傲的"透明"和"可控",在这个版本差里悄悄蒸发。
当然,V4-Pro正式版8月就要来了。如果DeepSeek给Pro也来一次同样的post-training重训,整个榜单还会再动一次。届时克劳德可能就不是"领先5.7分"了,而是"勉强保住面子"。
对于写代码的普通人来说,结论很简单:如果你不需要完全自主控制数据,DeepSeek V4-Flash现在就是性价比最高的AI编程助手候选。便宜了52倍,性能差不到哪去——这个账很容易算。