同一个模型,参数没变、架构没变、价格没变,突然就把自家旗舰版按在地上摩擦了。
7月31日,DeepSeek把V4-Flash的0731版本推入公开API测试。在9项智能体和编程基准测试里,新版全部超过自家旗舰预览版V4-Pro-Preview——最夸张的是DeepSWE基准,从7.3分暴涨到54.4分,涨幅7倍。用的方法不是堆参数,而是重新训练了一次。
价格呢?每百万Token输入0.14美元、输出0.28美元,跟4月份完全一样。
对比一下你就知道这事有多卷了:
(1) Claude Opus 4.8在每项基准上都比V4-Flash-0731高,平均高出5.7分
(2) 但Claude的价格是DeepSeek的52倍
(3) 换算成"每分性能的成本",DeepSeek只要0.002美元,Claude要0.106美元
换个说法:你要跑一个代码审查智能体,Claude多给你的那2.3分Terminal Bench分,每分值0.1美元;DeepSeek的每分只值0.002美元。差50倍。
当然,Claude Opus 4.8目前还是更强的那一个。DeepSeek没有在任何一个基准上跑赢它。只是这个差距,用50分之1的钱就能追到只剩几分——对于非关键业务的内部工具,这个账太好算了。
但有个坑:这次更新只发了API,Hugging Face上开源的权重还是4月份的预览版。你自己部署一个跑,分数还是7.3,不是54.4。想用强的那版,只能走DeepSeek的接口。
这意味着"开源"和"最强"之间,第一次出现了超过3个月的裂缝。开源社区等了3个月,等来的还是阉割版。V4-Pro正式版预计8月出来,到时候会不会同步开源权重,现在还不知道。
对国内团队来说还有个额外问题:流量走DeepSeek的服务器,数据全在国内。对于有数据主权要求的公司,这个成本省不了。
DeepSeek这招的本质很清楚:不是靠参数规模领先,而是靠"同样的参数,我训练得更好"来抢市场。如果这条路跑通,以后各家AI公司的护城河就不是比谁显卡多,而是比谁训练得更聪明。
这对整个行业是好事。意味着搞AI应用的不用一直被"谁拿到最强模型谁就赢"这个逻辑卡着。模型可以更便宜,应用层的空间就大了。