Gemini 3.8 Live来了:Google把AI语音助手做成了"真能聊天的人"

9次阅读

Google昨天甩出了Gemini 3.8 Live和3.8 Live Extended Thinking两款新模型。简单说:你跟AI说话的时候,它不再像个背诵机器,开始像个会接话的人了。

9月15日,Google在官方博客发布了这对组合拳。主打两个能力:

(1) 并行推理——AI一边跟你聊,一边在后台跑复杂任务,两件事不打架

(2) 实时视觉理解——你打开摄像头拍东西,AI能看到画面并基于此回答问题

过去一年,AI语音助手最大的槽点是"假"。你问它个问题,它要么慢吞吞憋半天,要么答非所问,要么一被打断就死机重启。Gemini 3.8 Live直接对着这些毛病开刀。

几个关键升级点:

(1) 中途打断它不会"失忆"。你话说到一半突然改口,它能接住你的新方向

(2) 多语言无缝切换。中英夹杂跟它聊,它不会懵

(3) Extended Thinking版本会把思考过程"念"出来,告诉你它为啥这么回答

(4) 后台调用工具不影响对话流畅度。比如你让它查个航班,它一边查一边继续跟你唠

这些能力不只服务消费者。Google Workspace、Search、Gemini app同步上线,开发者也能通过Gemini API直接接入。

为什么这次升级重要?因为AI语音赛道已经挤满了玩家。OpenAI有Realtime API,Anthropic的Claude也在加音频能力,Meta、亚马逊、苹果都在自研。Google这次等于是在"自然对话"这个细分维度上,把门槛又抬高了一档。

更狠的是Extended Thinking这个设计。一般AI推理模型都是文字交互,思考过程藏在后台。Gemini 3.8 Live Extended Thinking把思考过程语音化了——它会一边"想"一边跟你说话,让你知道它在干嘛。这等于把"AI在思考"这个黑盒打开给你看。

对普通人意味着什么?你可以让AI当你的实时翻译、面试陪练、辩论对手、教学助手。它不再是个工具,更像是个能在你思考时跟你对话的人。

当然,模型再强也得用得起。Google没公布具体定价,但参考之前Gemini Live的定价策略,普通用户免费额度肯定有限,深度使用得买Google AI Pro或者Workspace订阅。

AI语音这条赛道,已经不是比"能不能说话",而是比"像不像真人在跟你聊"。Google这次显然想明白了:用户不在乎你参数量多大,只在乎你接话接得自不自然。

正文完
 0