Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking:边推理边说话,97 种语言实时切换
2026年9月15日,Google 在官方博客发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,作者署名为首席工程师 Tom Ouyang 与 Gemini Audio 团队成员 Malini Jaganathan。两款模型的定位被拆得很清楚:3.8 Live 面向规模与成本效率,把对话智能、流畅对话与视觉基础能力合在一起;3.8 Live Extended Thinking 面向高复杂度任务,追求更高的智能水平与多步推理。Google 在更新说明里的说法是,这两款模型给开发者与企业提供了构建可靠、可直接上生产环境的语音智能体的积木。这句话的重点在语音智能体上——Google 卖的不只是聊天更好听,而是能用语音把一个多步骤任务从头跑完。
两款模型的分数是第一件值得记的事情。3.8 Live Extended Thinking 在 Artificial Analysis 的 Speech to Speech Quality Index 上拿到 82.6 分,居第一位;在 τ-Voice 上拿到 68.6%,在 Sierra 的 τ-Voice-banking 基准上拿到 35.1%,Google 用这两个数字来说明它在智能体式任务完成上的领先。推理能力方面,它在 Big Bench Audio 上得分 97.7%,同时价格相比其他前沿模型仍具竞争力。3.8 Live 则在 Speech Agent Arena 里获得第二名的用户偏好位置,Google 强调它依然保持很高的成本效益。在 ServiceNow 用于评估语音智能体的 EVA-Bench 上,Google 说这两款模型通过平衡准确率与对话质量,把复杂工作流的帕累托前沿又往前推了一截,并特别注明这项测试是在 Gemini Enterprise Agent Platform 上的 Live API 跑的。分数量级和测试口径都来自 Google 官方博客,引用时值得注意基准名称与平台限定条件。
第二个值得记的是工程细节。3.8 Live 近实时处理视觉输入,用上下文把对话撑得更实用;它能自动检测并在 97 种支持语言之间中途切换,也就是说用户在一段对话里换语言不需要重开会话。更容易被忽略的是后台执行能力:3.8 Live 会在对话继续的同时在后台执行工具调用与 API 调用,因此它可以先确认请求,然后一边继续聊天一边等任务在后台完成。3.8 Live Extended Thinking 走了另一条路:它同时推理和说话。Google 描述了具体做法——用 Let me check that… 这类早期口头线索自然地接住用户,再用实时进度旁白把多步骤后台任务的过程讲出来。这个设计的意图很清楚:解决语音智能体过去最让人烦躁的沉默空档。官方博客给出的演示场景包括实时指导员工入职、近实时下棋,以及把草图加语音反馈直接转成可运行的 React 组件、协同完成多步骤预订与异步函数调用、当场生成完整商业计划与定制营销工具包。
落地渠道和生态是第三块信息。开发者侧,两款模型都在 Gemini API 和 Google AI Studio 上线;企业侧在 Gemini Enterprise 进入私测,并即将进入 Gemini Enterprise for Customer Experience 与 Google Workspace 商业客户。面向普通用户,3.8 Live 进入 Search Live,3.8 Live Extended Thinking 进入 Gemini Live,并面向 Google AI Pro 与 Ultra 订阅者在 Workspace 的 Docs 中提供、面向所有 Google AI 订阅者在 Gmail 和 Keep 中提供。Google 还列了一批通过 Gemini Live API 接入的开发者平台:Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agents,这些平台负责处理复杂的实时媒体串流基础设施,让开发者专注于用户体验。合作方名单里出现了 Salesforce、Genspark 和 Lumeris,Google 说他们看重的是低延迟、流畅度与工具调用能力。需要注意一点,官方博客写的是 3.8 Live 与 3.8 Live Extended Thinking 从当天开始滚动上线,滚动上线意味着并非所有用户在同一时间看到入口。
最后是安全与来源两件事。Google 明确写了所有由其 AI 产品生成的音频都会用 SynthID 加上水印,这种不可感知的水印直接织进音频输出,目的是让 AI 生成内容保持可检测,帮助防止虚假信息扩散,具体安全与责任做法在其 model card 里有说明。来源方面,这篇博客发布日期是 2026 年 9 月 15 日,页面底部标注最后更新于 2026 年 9 月 17 日,引用基准分数时对一下这个时间差;另外,Google 在页面里还挂了同系列的两篇相关文章,分别是 Gemini 3.8 Flash 与 3.8 Flash Cyber 的发布、以及面向政府与企业的主动网络防御。还有一点需要提醒:搜索里流传的按小时计费价格这类信息,并不在本篇官方博客正文中,本文因此不引用具体价格数字,只保留官方明确给出的成本效率与竞争力表述。要我给一个引用建议的话:分数与渠道以官方博客为准,价格看官方定价页面。
🤔 常见问题解答
Q1: Gemini 3.8 Live 和 3.8 Live Extended Thinking 的区别是什么?
3.8 Live 面向规模与成本效率,组合了对话智能、流畅对话与视觉基础能力,在 Speech Agent Arena 位列第二;3.8 Live Extended Thinking 面向高复杂度任务,追求更高智能水平与多步推理,在 Artificial Analysis 的 Speech to Speech Quality Index 上以 82.6 分居首。可以理解为前者适合大规模低成本部署,后者适合需要深度推理的复杂工作流。
Q2: 官方公布的基准成绩有哪些?
3.8 Live Extended Thinking:Artificial Analysis Speech to Speech Quality Index 82.6 分排名第一;τ-Voice 68.6%;Sierra τ-Voice-banking 35.1%;Big Bench Audio 97.7%。3.8 Live 在 Speech Agent Arena 位列第二。两款模型在 ServiceNow 的 EVA-Bench 上被 Google 描述为推进了复杂工作流的帕累托前沿,该次测试在 Gemini Enterprise Agent Platform 的 Live API 上运行。
Q3: 普通用户在哪里能用上?
3.8 Live 进入 Search Live;3.8 Live Extended Thinking 进入 Gemini Live,并面向 Google AI Pro 与 Ultra 订阅者在 Workspace 的 Docs 中提供、面向所有 Google AI 订阅者在 Gmail 和 Keep 中提供。开发者侧在 Gemini API 与 Google AI Studio,企业侧在 Gemini Enterprise 私测。官方说明两款模型从发布当天开始滚动上线,因此入口出现的时间会因用户而异。
Q4: 音频内容有水印吗?
有。Google 明确说明所有由其 AI 产品生成的音频都会加上 SynthID 水印,这种水印不可感知、直接织进音频输出,目的是让 AI 生成内容保持可检测,从而帮助防止虚假信息扩散;具体的安全与责任做法在其 model card 中有说明。
🛠️ 推荐工具
这次发布里最让我在意的不是分数,而是 Let me check that… 这一句话被写进了官方博客。过去用语音助手最难受的时刻,是你说完一句话之后它安静了十几秒,你不知道它在想、在卡、还是已经死了。Google 的解法是让模型把思考过程讲出来——先用一句口头禅接住你,再一边推理一边报进度。这等于承认了语音交互的核心体验问题不是识别准不准,而是沉默太长。另一个细节是 97 种语言中途切换:以往多语言对话要么提前选语种,要么识别错乱,现在这段边界被抹掉了。至于后台执行工具调用,它让语音从问答界面变成了任务界面,这才是这代模型位置变化的地方。要说保留意见,也有——基准分数里有一项明显注明了所跑的平台,滚动上线也意味着你我不一定今天就能用上,实际情况得看自己账号里的入口。
总结
2026年9月15日(9月17日更新),Google 官方博客发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时对话模型,作者为 Tom Ouyang 与 Malini Jaganathan(代表 Gemini Audio 团队)。3.8 Live 面向规模与成本效率,组合对话智能、流畅对话与视觉基础能力,在 Speech Agent Arena 位列第二;3.8 Live Extended Thinking 面向高复杂度任务,追求更高智能与多步推理,在 Artificial Analysis Speech to Speech Quality Index 以 82.6 分排名第一,τ-Voice 68.6%,Sierra τ-Voice-banking 35.1%,Big Bench Audio 97.7%。3.8 Live 近实时处理视觉输入,自动检测并在 97 种支持语言间中途切换,并在对话继续的同时后台执行工具与 API 调用;3.8 Live Extended Thinking 同时推理与说话,使用 Let me check that… 等早期口头线索接住用户,并用实时进度旁白说明多步骤后台任务。两者在 ServiceNow EVA-Bench 上被描述为推进复杂工作流帕累托前沿(测试运行于 Gemini Enterprise Agent Platform 的 Live API)。开发者侧已在 Gemini API 与 Google AI Studio 上线;企业侧在 Gemini Enterprise 私测,并将进入 Gemini Enterprise for Customer Experience 与 Google Workspace 商业客户;普通用户在 Search Live、Gemini Live、Workspace Docs(Google AI Pro/Ultra)、Gmail 与 Keep(所有 Google AI 订阅者)可用。生态伙伴包括 Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agents,以及 Salesforce、Genspark、Lumeris。所有生成音频均带 SynthID 水印。两款模型从发布当天开始滚动上线。以上均来自 Google 官方博客,本文不引用官方正文未给出的价格数字。主要来源:Google 官方博客(2026年9月15日发布,9月17日更新)。
来源链接:Google Blog: Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking