一条推文,一行代码,DeepSeek把自家模型的AI编程能力抬升了7倍。
7月31日,DeepSeek悄悄上线了V4-Flash-0731版本。没有发布会,没有新闻稿,连架构都没动——2840亿参数,130亿激活,100万token上下文窗口,一个都没变。唯一改的是训练方式。
结果:在DeepSeek自己发布的9项Agent和编程基准测试里,新版本把旗舰预览版V4-Pro按在地上摩擦。编程能力测试DeepSWE从7.3分暴涨到54.4分,涨了将近7倍。价格没变,每百万token输入0.14美元,输出0.28美元。
怎么做到的?答案写在论文里:Post-training。
DeepSeek没换硬件,没加参数,就是换了一套更聪明的训练方法。相当于同样的发动机,调校之后动力翻倍。业内把这叫做"小步快跑"——不追大模型军备竞赛,靠优化赚钱。
几个数字感受一下:
(1) Claude Opus 4.8在这9项测试里依然最强,平均领先5.7分
(2) 但Claude每百万token成本是DeepSeek的53倍
(3) Terminal Bench测试,DeepSeek 82.7分,Claude 85分,差距只剩2.3分
对于预算有限的小团队,这条新闻很直接:花1/53的价格,能买到接近Claude 95%的Agent编程能力。你要不要省这笔钱?
但有个坑:开源权重党这次被耍了。
Hugging Face上放出的DeepSeek V4-Flash权重是4月份的旧版本——也就是得分7.3的那个。新版0731只存在于DeepSeek官方API里。想用性能更强的版本?只能调用他们的接口,自己部署用的是老版本。
这不是DeepSeek第一次这么干。但确实是第一次让开源用户和API用户产生分裂——同样叫V4-Flash,实际是两个东西。
对于把DeepSeek当省油钱工具的开发者来说,这条新闻利好:模型更强了,还不涨价。对于冲着开源 sovereignty 去的团队,这是个警示:API和权重不同步,开源不等于你能控制的东西。
接下来看8月:V4-Pro正式版要发,如果也走0731这个路线,整个测试表格又要重写。
AI大模型的价格,已经没有最便宜,只有更便宜。