Gemini 3.8 Live 与 3.8 Live Extended Thinking 实时语音对话模型
Google 于 2026 年 9 月 15 日在官方博客发布,官方称这是其迄今最先进的实时对话模型:Gemini 3.8 Live 面向规模与成本效率,结合对话智能、流畅对话与视觉理解,可在对话中自动检测并切换 97 种语言,并在继续对话的同时在后台执行工具与 API 调用;3.8 Live Extended Thinking 面向高复杂度任务,边推理边说话并以实时进度叙述多步后台任务,在 Artificial Analysis 语音到语音质量指数上以 82.6 取得总体第一
工具概览
功能、使用步骤与常见问题见下方
功能特点
- ✓ 两个模型定位:官方称 Gemini 3.8 Live 面向规模与成本效率,结合对话智能、流畅对话与视觉基础;3.8 Live Extended Thinking 面向高复杂度任务,具备更强智能与多步推理能力
- ✓ 基准表现:官方称 3.8 Live Extended Thinking 在 Artificial Analysis 语音到语音质量指数上以 82.6 取得总体第一,τ-Voice 达 68.6%、Sierra τ-Voice-banking 达 35.1%、Big Bench Audio 达 97.7%;3.8 Live 在 Speech Agent Arena 中排名第二且性价比高
- ✓ 近实时视觉与多语言:官方称 Gemini 3.8 Live 近实时处理视觉输入,为对话补充上下文,并可在对话中途自动检测与切换 97 种受支持语言
- ✓ 后台执行与边想边说:官方称 3.8 Live 在继续对话的同时在后台执行工具与 API 调用;3.8 Live Extended Thinking 边推理边说话,用「Let me check that…」等早期口头线索自然回应,并以实时进度叙述多步后台任务
- ✓ SynthID 水印与开发者生态:官方称所有音频都以 SynthID 不可感知水印标;Gemini Live API 及 Agora、LangChain、LiveKit、Pipecat、Vercel 等平台支持开发者构建与部署高性能语音交互界面
使用步骤
- 开发者可在 Gemini API 与 Google AI Studio 使用 3.8 Live 与 3.8 Live Extended Thinking
- 企业可在 Gemini Enterprise 私有预览中使用(3.8 Live Extended Thinking 亦将面向 Google Workspace 商业客户)
- 普通用户在 Search Live 使用 3.8 Live;订阅用户可在 Gemini Live 及 Workspace 的 Docs(Google AI Pro 与 Ultra)与 Gmail、Keep(全部 Google AI 订阅)中使用
- 开发者可通过 Gemini Live API 及支持的第三方平台构建与部署语音驱动的交互界面
常见问题
这两个模型是什么?
Google 称 Gemini 3.8 Live 与 3.8 Live Extended Thinking 是其迄今最先进的实时对话模型,前者面向规模与成本效率,后者面向需要更强智能与多步推理的高复杂度任务。
如何体验?
Google 称 3.8 Live 自发布当天起面向开发者在 Gemini API 与 Google AI Studio、面向企业于 Gemini Enterprise 私有预览、面向所有人在 Search Live 推出;3.8 Live Extended Thinking 亦在 Gemini API、AI Studio 与 Gemini Live 及 Workspace 的部分订阅层级推出。
性能如何?
Google 称 3.8 Live Extended Thinking 在 Artificial Analysis 语音到语音质量指数上以 82.6 取得总体第一,τ-Voice 达 68.6%、Sierra τ-Voice-banking 达 35.1%、Big Bench Audio 达 97.7%。
支持多少种语言?
Google 称 Gemini 3.8 Live 会在对话中途自动检测与切换 97 种受支持语言。
音频是否可被识别为 AI 生成?
Google 称所有由其 AI 产品生成的音频都以 SynthID 不可感知水印标,便于检测 AI 生成内容,以帮助防止误导信息。