三周,谷歌就把 Gemini Flash 从 3.6 干到了 3.7。
8月13日,Gemini 3.7 Flash 正式上线。距离上一代 3.6 Flash 全面开放(7月21日),只过去了 23 天。
这节奏不是 bug,是 feature。谷歌摆明了告诉开发者:别拿 Flash 当主力机型养了,它就是被快速替换的基础设施。
真正让人坐不住的是价格。3.7 Flash 入门 API 价格砍了一半——输入端每百万 token 只要 0.75 美元,输出端 3.75 美元。
对比上一代 3.6 Flash 原来的 1.50 / 7.50 美元,直接腰斩。
几个关键数据:
(1) 同样的腰斩价,谷歌也给 3.6 Flash 套上了——这是促销价,不是 3.7 专属福利
(2) 这波优惠到 2026 年 12 月 31 日截止;2027 年 1 月 1 日起恢复原价 1.50 / 7.50 美元
(3) DeepSWE 编码基准测试,3.7 Flash 高负载跑出 65%,3.6 Flash 只有 47%
(4) 1 百万 token 上下文窗口,最大输出 6.4 万 token
(5) 三个思考档位:低、中、高,默认开中档
低档拼速度,跑客服聊天、应急响应、临时数据分析;高档舍得花算力,啃难代码、数学题、多步推理+工具调用的 Agent 工作流。开发者可以按任务难度切换,不用每个请求都拉满推理。
谷歌自家的"常驻 Agent"——Gemini Spark,已经切到 3.7 Flash,能跨任务整理文件、写邮件、改状态文档。
价格战的逻辑在变。
过去几年,AI 模型公司拼的是基准测试榜单、上下文窗口长度、推理能力排名。但当模型跑进生产环境,调用量是按百万、千万次算的——一个略胜一筹但费 token 的模型,部署起来能把一家公司账单烧穿。
谷歌这次同时按"性能"和"成本"两个按钮:模型更聪明,但跑 Agent 规模化部署更便宜。
对普通用户意味着什么?
如果你用的是 Gemini App、Google Workspace 里的 AI 助手、Spark 这类内置 Agent,3.7 Flash 切换后响应会更准、更少卡壳,一次跑通的概率比上一代明显高。背后这部分算力成本,谷歌暂时替你扛了一半。
但有个时间陷阱:12月31日之后,开发者侧的 API 价格恢复原价。届时用 3.7 Flash 跑大批量任务的公司,要么提前锁定优惠期内的合同,要么准备面对翻倍的账单。
三周换一次模型,这个节奏对开发者是个新挑战。3.6 Flash 还没捂热,3.7 就来了;据传 Gemini 4 已经在路上。企业的测试、迁移、优化周期得跟着谷歌的发布频率走,否则永远在追版本。
Flash 已经不像"模型"了,更像每月更新的基础设施——像 CDN 节点,像 Kubernetes 版本号。
AI 的下半场,比的是迭代速度,不是谁一次性能憋出大招。