DeepSeek 今天扔出一颗炸弹:V4.1 Flash 正式上线,号称在性能、成本、速度和总耗时四个维度全面超越自家上一代旗舰 V4 Pro。9月14日中午开始,所有调用 deepseek-v4-pro 的请求会自动路由到 V4.1 Flash,按 Flash 价格计费。
这套操作的意思很明确:DeepSeek 自己都不再推荐 V4 Pro,直接把它退市了。
V4.1 Flash 表面看是个轻量模型,实际是个巨无霸。总参数 552B,其中 196B 是 Engram 记忆模块,可以扔在 SSD 上不占内存。真正激活的参数:prefill 阶段 8B,decode 阶段 16B。
这意味着什么?
(1) 模型规模涨了 3 倍,但单次推理成本没涨
(2) 8B 激活参数跑推理,相当于一个「够用」的小模型
(3) 196B 的 Engram 像外挂数据库,按需读取
DeepSeek 把「大部分参数是冷数据」这条路走通了。别人还在堆 H100 集群,DeepSeek 已经能用消费级显卡跑顶级模型——HN 讨论里有开发者算出,三张 NVIDIA Spark 或四张 RTX PRO 6000 就能本地部署。
价格方面,Flash 模型 API 输入 0.14 美元/百万 tokens,输出 0.28 美元/百万 tokens。比 GPT-5.5 Pro 便宜 20 倍,比 Claude Opus 4.5 便宜 15 倍。开源权重已经同步放上 Hugging Face 和 GitHub,任何人都能下载跑在自己机器上。
这不是技术演示,这是直接抢市场。
OpenAI 和 Anthropic 的旗舰 API 价格一直下不来,因为它们要把推理成本转嫁给用户。DeepSeek 反过来:先把单次推理的成本砍到地板,再用 552B 的总参数把智能水平拉满。Flash 模型在 Terminal Bench 2.1 跑分 82.7,在 DeepSWE 编程评测拿到 54.4,两项都超过 V4 Pro 预览版。
KV 缓存的优化更夸张——1M tokens 上下文只需 900MB 缓存,比上一代减少 4 倍。这背后是 KV 压缩算法的突破,长文本场景的吞吐量直接翻倍。写代码、读论文、做数据分析这类需要长上下文的活,V4.1 Flash 比 V4 Pro 快得多,便宜得更多。
DeepSeek 还顺手发布了一个叫 Harness 的开发者预览版,面向全球做 Agent 的团队。可以让 Claude Code、GitHub Copilot、OpenCode 这些工具直接用 DeepSeek 当后端模型,不用改一行代码。
这条线的潜台词是:你不需要再为 OpenAI 写 OpenAI SDK,为 Anthropic 写 Anthropic SDK。用 DeepSeek 就行,API 完全兼容 OpenAI 和 Anthropic 双格式,base_url 一换就上。
OpenAI 的反应会很有趣。Anthropic 也在关注这个市场——它们的 Opus 模型靠高质量数据堆出来,但每 token 成本是 DeepSeek 的十几倍。V4.1 Flash 这种「开源 + 便宜 + 够用」的打法,正在掏空西方 AI 公司的定价根基。
开发者圈已经炸锅。HN 上相关讨论帖 4 小时就冲到首页第一。有人说「DeepSeek 一年时间把整个 LLM 行业的经济学改了」,有人说「GPT-6 出来前,DeepSeek 是所有人的默认选择」。Hugging Face 上 deepseek-ai/DeepSeek-V4.1-Flash 仓库四小时内被下载了上万次。
9月14日,V4 Pro 就此退场。一个曾经被业内寄予厚望的旗舰模型,在自家小弟面前连三个月都没撑过去——V4 Pro 7月31日才正式上线,今天就被自家 V4.1 Flash 顶替。
DeepSeek 用 V4.1 Flash 给整个 AI 行业上了一课:参数不是越多越好,价格不是越贵越香。当 552B 总参数的模型能做到 0.14 美元/百万 tokens,所有定价 10 倍以上的「高端模型」都得重新解释自己贵在哪。
这堂课,OpenAI 和 Anthropic 该抄一抄了。再不抄,开发者用脚投票,整个市场就要换主人。