六周,三个 Flash 模型。谷歌这是要把 Pro 鸽到底的节奏。
9月2日,谷歌又发了一个新模型——Gemini 3.8 Flash。这已经是六周内谷歌发布的第三个 Flash 变体。配合一起出的还有个安全专用的 Gemini 3.8 Flash Cyber,专攻漏洞识别和自动打补丁。
如果你还记得年初谷歌承诺的 Gemini 3.5 Pro,那你可能要继续等下去了。
几个关键数据:
(1) API 价保持白菜价:输入 $0.75/百万 token,输出 $3.75/百万 token,优惠期到年底
(2) 16 项基准测试里,9 项压过 Claude Opus 5 和 GPT-5.6 Sol
(3) DeepSWE 软件工程榜单登顶,DeepSWE-1.1 跑出 73.7%,比 GPT-5.6 Sol 高 1 个百分点
(4) 安全版 Cyber 在 CyberGym 漏洞识别测试拿到 86.2%,比 Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%)都高一截
(5) 谷歌 Chrome 团队反馈:用 Cyber 修漏洞,正确率是过去的 2.6 倍;Cloud 团队两小时挖出一个关键漏洞
价格是这次最值得关注的。$0.75/百万 token 输入,跟上一代 3.7 Flash 一样没涨价。谷歌明显知道光靠性能已经不够,DeepSeek 把价格砍到 1/52、Grok 持续走低,没人在性能上一家独大。现在三家比的是谁更便宜、谁更能打工人。
对普通用户来说,今天起在 Gemini App 里能用上 3.8 Flash(需要 Pro 或 Ultra 订阅),免费的话去 AI Studio 玩。Cyber 版普通人用不到,只对政府、关键基础设施和软件公司开放。Fairwind 项目首批 650 多家合作伙伴,包括 Snowflake、CrowdStrike、Datadog 这些大厂。
对开发者来说,3.8 Flash 这次主打工智能体(Agent)任务和复杂编码。谷歌放出的内部数据显示,在 Terminal-Bench 1.1(多步骤编码测试)、金融数据分析、图表理解这几项上,3.8 Flash 都比前代更准。它的关键设计哲学谷歌自己说得很直白:「3.8 Flash 更努力了」——遇到复杂任务,它愿意多花 token、多调几次工具,把结果打磨到最准。
不过有一个细节值得吐槽。OSWorld-2.0 是测模型操控电脑能力的基准,3.8 Flash 虽然比 3.7 Flash 强,但还是被 Claude Opus 甩在身后。GPT 也差。换句话说,你能用 ChatGPT 帮你点鼠标、填表格的时代还没真正到来。
另一边,谷歌承诺的 Gemini 3.5 Pro 至今没影。年初谷歌推迟过一次发布,因为编码性能不够硬。现在 Flash 已经冲到 DeepSWE 榜首,外界猜测谷歌索性让 Flash 系列包揽「中端 + 高性价比」的位置,Pro 直接凉凉。
三个 Flash 模型挤在六周里发,节奏紧到不像大厂的作风。这是在抢市场——Anthropic、OpenAI、xAI 都在降价,DeepSeek 在卷开源。Flash 是谷歌手里能最快出手的牌,就一直打。
真正的旗舰模型在哪儿?谷歌没说。但从商业逻辑看,Flash 已经够用、够便宜、够开发者喜欢的时候,Pro 也许永远不会来了。