谷歌今天又掏出一个新模型:Gemini 3.8 Flash。
这是6周内的第三个Flash版本。年初承诺的Gemini 3.5 Pro,鸽了。
Flash成了谷歌AI的亲儿子,Pro成了没人管的弃子。
3.8 Flash分两个版本:普通版是个"全能打工人",写代码、做Agent、跑任务都能上;另一个叫3.8 Flash Cyber,专门干网络安全,专找漏洞、自动打补丁。
普通用户怎么用上?两条路。
(1) Gemini App里要用,得开Pro或Ultra订阅,每月几十刀。
(2) 免费去Google AI Studio,自己写代码调API。年底前有折扣价:输入每百万token 0.75美元,输出3.75美元。明年恢复原价1.5/7.5。
两个价格都比Claude Opus、GPT贵模型便宜一截。谷歌心里清楚——DeepSeek、阿里、智谱这帮人都在打价格战,它不降价,企业就跑了。
几个关键数据:
(1) DeepSWE代码排行榜冲到第一,比3.7 Flash分数高出一截
(2) OSWorld-2.0(测AI操控电脑的能力)比上一代有进步,但还是被Claude Opus吊打
(3) Chrome安全团队用3.8 Flash Cyber后,修补丁的准确率涨了2.6倍
(4) 谷歌云团队用它2小时挖出一个高危漏洞
DeepSWE这个榜单有点意思。它专门测AI解决真实软件工程问题的能力,不是考试题,是真活儿。3.8 Flash拿下第一,意味着你丢给它一段复杂代码让它debug、修bug、改架构,它能干得比所有竞品好。
但有个尴尬的事:3.8 Flash Cyber现在只给"可信测试者和政府机构"用。普通人想玩?没门。
这事挺反常的。一个号称能挖漏洞、修漏洞的AI,自己却被锁起来不让普通开发者碰。谷歌的逻辑是:这类工具落到坏人手里后果太严重,所以先卡死出口。Wiz、Palo Alto Networks这种安全巨头可以试用,但GitHub上想找个开源版本?没戏。
另一边,Claude Opus在"操控电脑"这件事上继续领跑。你想让AI自己开浏览器、点按钮、填表格、处理Office文档?Claude Opus是目前最靠谱的选手。Gemini、GPT都还差一截。
OpenAI也好,谷歌也好,最近都在疯狂卷Flash、Turbo、mini这种"小而快"的版本。真正最顶级的旗舰模型,反而不怎么更新了。
为什么?因为贵啊。
训练一个GPT-5.6级别的大模型,几千万美元打底,回报周期却越来越长。开源模型追得越来越紧,你花大钱训出来的东西,半年就被DeepSeek用百分之一的成本抄走大半。
不如把中等大小的模型做到极致,便宜、快速、能跑量,赚API的钱。旗舰模型?留着秀肌肉就行。
对普通开发者来说,这是好事。AI编程工具越来越便宜,越来越能干,过去要花几百刀API费的任务,现在几美元搞定。
但对那些押注"AGI明年就到"的硅谷大佬来说,谷歌这种"小步快跑、放弃旗舰"的打法,可能预示着AI革命的节奏没那么快。
革命还没来,工具先普及了。