Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking:一边说话一边思考,97 种语言自动切换

2026-09-16·9分钟阅读

2026年9月15日,Google DeepMind 发布了两款实时语音模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,署名的是 Gemini Audio 团队。官方博客把这两款称为目前最先进的实时对话模型,核心变化是「近实时推理」:模型可以在后台一边跑多步推理、一边说话,还能在对话中途自动检测并切换语言,官方给出的数字是 97 种。发布渠道铺得很开——Gemini API、Google AI Studio、Gemini 应用、Google Workspace 里的 Docs Live / Gmail Live / Keep Live,还有搜索里的 Search Live。值得留意的是节奏:这是 Google 一个月内第三次发 Gemini 模型,前两次分别是 3.7 Flash 和 9 月 2 日的 3.8 Flash 与 3.8 Flash Cyber。

先说两个模型的定位差别。Gemini 3.8 Live 面向规模和成本效率,主打流畅的对话智能加视觉理解;官方给的旁证是它在 Speech Agent Arena 里排到第二,并且价格相比同级别前沿模型更有竞争力。Gemini 3.8 Live Extended Thinking 面向高复杂度任务,官方描述里最关键的词是「同时推理与说话」:它会先用一句自然的口头提示接住你的请求,比如 Let me check that,然后在后台跑多步任务的过程中持续口头播报进度,而不是让对话停在那里等答案。官方给的场景包括边看手绘草图边语音反馈、实时生成可用的 React 组件,以及完成多步骤预订和异步函数调用。对任何用过语音助手的人来说,这个差别很直观——以前的语音助手是「说完等结果」,现在是「一边听你说一边干活」。

成绩单这部分值得逐条看,因为语音模型的评测口径和文本模型完全不同。Gemini 3.8 Live Extended Thinking 在 Artificial Analysis 的语音对话质量指数(Speech to Speech Quality Index)上拿到 82.6 分,官方说是总榜第一;在 τ-Voice 这个衡量智能体式任务完成的基准上是 68.6%,在 Sierra 的 τ-Voice-banking 基准上是 35.1%;推理方面在 Big Bench Audio 上是 97.7%。另外官方提到,在 ServiceNow 的 EVA-Bench 上,这两款模型在准确率与对话质量的平衡上把帕累托前沿往前推了一截,并注明这项测试是在 Gemini Enterprise Agent Platform 的 Live API 上跑的。这些数字的读法需要一点耐心:82.6 是「听起来像不像人、接不接得住」的综合分,68.6% 和 35.1% 是「事情有没有真的办成」的完成率,97.7% 是纯推理能力。三个数字指向的是三件不同的事,把它们混在一起谈就容易得出错误结论。

能力细节上有几处是工程上真正有用的。Gemini 3.8 Live 处理视觉输入是近实时的,也就是说你一边举着镜头一边说话,模型能吃进画面里的信息;它在对话中自动检测并切换 97 种支持语言,不需要用户手动切换;它在后台执行工具调用和 API 请求时不会中断对话,所以可以一边口头应答一边等任务完成。官方举的例子包括实时指导员工入职流程、看棋盘做近实时对弈。开发者生态那一层,Google 点名了 Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents 这些平台已经通过 Gemini Live API 支撑语音界面开发,背后那些实时媒体流的复杂度由平台处理;合作方名单里出现了 Salesforce、Genspark 和 Lumeris。另外所有生成音频都带 SynthID 水印,这是 Google 在生成内容溯源上的一贯做法。

把这条新闻放到本周的语境里,能看出更清楚的位置。一是发布节奏:三周前是 3.7 Flash,9 月 2 日是 3.8 Flash 与 3.8 Flash Cyber,9 月 15 日是 3.8 Live 与 3.8 Live Extended Thinking,一个月三款,这和 2025 年那种接近季度的节奏完全不同。二是竞争方向:TechCrunch 系的报道把这次发布直接解读成对标 OpenAI 的 GPT-Live-1,打法是「能力接近但价格低得多」,也就是抢开发者调用量而不是抢榜一。三是评测口径的诚实问题:语音模型的 82.6 分和文本模型的分数不能横向比较,τ-Voice-banking 只有 35.1% 说明在真实银行业务这种落地场景里,语音智能体还远没到可以放手不管的程度。对于正在做语音产品的团队来说,最有价值的信息反而是那个 35.1%——它告诉你哪里的坑最深。

🤔 常见问题解答

Q1: 两个模型到底有什么区别?

按官方定义,Gemini 3.8 Live 为规模与成本效率设计,把对话智能、流畅对话和视觉理解结合起来,适合高并发、对延迟敏感的日常场景;Gemini 3.8 Live Extended Thinking 为高复杂度任务设计,智能更高、支持多步推理,并且能一边推理一边说话、持续播报进度。简单说:一个主打便宜好用扛量,一个主打能办复杂的多步事。

Q2: 现在在哪里可以用?

官方说开发者可以通过 Gemini API 和 Google AI Studio 使用;普通用户在 Gemini 应用里就能用;办公场景下 Google Workspace 提供 Docs Live、Gmail Live 和 Keep Live;搜索侧集成在 Search Live 里,官方举的例子是获得分步骤的实时排障帮助。此外 Agora、LangChain、LiveKit、Pipecat、Vercel、Vision Agents 等开发者平台已经基于 Gemini Live API 支持语音界面开发。

Q3: 那些评测分数应该怎么读?

分三类看。对话质量类是 Artificial Analysis 语音对话质量指数 82.6 分,官方称总榜第一,衡量的是听感和对话流畅度;任务完成类是 τ-Voice 的 68.6% 和 Sierra τ-Voice-banking 的 35.1%,衡量的是智能体能不能真的把事情办成;推理类是 Big Bench Audio 的 97.7%,衡量的是纯推理能力。注意 τ-Voice-banking 只有 35.1%,说明在真实金融业务这类复杂场景里,完成率还有很大空间,这也是产品选型时最该盯住的数字。

Q4: SynthID 水印是什么,为什么这次要专门提?

SynthID 是 Google 用于给生成内容打不可见标记的水印技术。官方在这次的公告里写明,所有生成的音频都带 SynthID 水印。对语音模型来说这一点比文本更敏感:声音是最容易被用来伪造身份和制造误导的媒介,水印的意义是让生成音频在事后可以被识别出来源。对做产品的人来说,这意味着接入时要确认下游环节(转码、剪辑、二次录制)会不会破坏水印,否则合规意义上的可追溯性就落空了。

🛠️ 推荐工具

  • 文本转语音 - 想直观感受闭源语音模型和自己能调的参数差在哪,先用网页端把同一段文字合成几遍,比读评测表更有体感
  • 语音转文字 - 97 种语言自动切换听着很美,实际效果要自己验;把跨语言混说的录音丢进去跑一遍,转写质量就是最直接的体检
  • 音频转写 - τ-Voice-banking 只有 35.1% 这类数字,用真实业务录音做一次端到端转写加任务核对,比信榜单更能说明能不能上线

这次发布里我最在意的不是 82.6 这个第一,而是那个 35.1%。语音模型这两年给人的印象一直是「已经很自然了」,但银行业务场景下的任务完成率只有三成半,说明听感上的自然和业务上的可用之间还隔着一整段距离。真正让语音智能体跨过这段距离的,恰恰是这次发布强调的两件事:在后台执行工具调用而不打断对话,以及一边推理一边播报进度。因为用户能忍模型慢,但不能忍模型卡住不说话——把人留在对话里,本身就是产品能力的一部分。至于一个月连发三款模型这个节奏,放在过去是不可想象的,现在它更像是一种常态压力:迭代速度本身就是竞争手段,评测分数的半衰期也跟着变短了。

总结

2026年9月15日,Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,署名 Gemini Audio 团队。Gemini 3.8 Live 面向规模与成本效率,主打流畅对话与视觉理解,官方称其在 Speech Agent Arena 排名第二;Gemini 3.8 Live Extended Thinking 面向高复杂度任务,可同时推理与说话,用自然口头提示接住请求并持续播报多步后台任务进度。能力上:近实时视觉输入理解、对话中自动检测并切换 97 种语言、后台执行工具与 API 调用不打断对话。评测:Artificial Analysis 语音对话质量指数 82.6(官方称总榜第一)、τ-Voice 68.6%、Sierra τ-Voice-banking 35.1%、Big Bench Audio 97.7%,ServiceNow EVA-Bench 上称推高帕累托前沿(在 Gemini Enterprise Agent Platform 的 Live API 上测试)。可用渠道:Gemini API、Google AI Studio、Gemini 应用、Google Workspace 的 Docs Live / Gmail Live / Keep Live、Search Live。开发者生态:Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agents 基于 Gemini Live API 支持语音界面;合作方包括 Salesforce、Genspark、Lumeris。所有生成音频带 SynthID 水印。这是 Google 一个月内第三款 Gemini 发布(3.7 Flash → 9月2日 3.8 Flash 与 3.8 Flash Cyber → 9月15日 3.8 Live 系列)。主要来源:Google 官方博客(2026年9月15日)、Google DeepMind 模型卡 Gemini 3.8 Audio、the-decoder、Neowin。

来源链接:Google Blog · DeepMind model card: Gemini 3.8 Audio · the-decoder · Neowin