Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型
Google 于 2026 年 9 月 23 日在官方博客发布,官方称这是 Gemini 家族迄今最具表现力的音频生成模型:Gemini 3.8 Flash TTS 面向深度创意指导与角色设计,可用自然语言从零创造新声音、逐年逐句指导表演;Gemini 3.8 Flash-Lite TTS 面向高并发、成本敏感的规模化配音;两者提供超过 2,000 个可投产的声音、覆盖 100 多种语言与方言,并支持仅用 30 秒音频样本复刻声音,配合内建同意验证、SynthID 水印与 C2PA 凭证
工具概览
功能、使用步骤与常见问题见下方
功能特点
- ✓ 两个模型定位:官方称 Gemini 3.8 Flash TTS 面向深度创意指导与角色设计,用自然语言提示从零创造全新声音,并逐句指导表演、节奏、方言切换与垫话;Gemini 3.8 Flash-Lite TTS 面向高并发、成本高效的规模化配音与表现力语音代理
- ✓ 生成式声音设计与超大声音库:官方称 Gemini 3.8 Flash TTS 可跨 100 多种语言与方言,通过自然语言提示定制角色、口音与声音特征;并提供 2,000 多个可投产的声音,覆盖墨西哥西班牙语、魁北克法语、苏格兰英语等地区变体
- ✓ 声音复刻与安全:官方称仅需 30 秒音频样本即可复刻一致的声音轮廓,并配有内建同意验证(需提供与参考说话人匹配的口头同意录音)、SynthID 水印与 C2PA 凭证;AI Studio 中的声音复刻在伊利诺伊、得州、欧洲经济区、英国、瑞士与印度不提供
- ✓ 逐句指导与长音频:官方称可写舞台指示或用自然脚本线索指导每一句的表现;支持数小时连续音频保持高音质、自然节奏与角色音色、说话人漂移极小,并支持原生双人场景编排与脚本化的人声爆发与垫话
- ✓ 基准与可用性:官方称 Gemini 3.8 Flash TTS 在 Hume AI 的 Voice Design Benchmark 取得总体第一(71.4),口音建模第一(60.8),并与 Flash-Lite TTS 分别取得 Hume AI Overall Quality Index 的第一与第二;已在 Gemini API、Google AI Studio 与 Gemini Notebook 推出,Flash-Lite TTS 还在 Google Vids 推出
使用步骤
- 开发者可在 Gemini API 与 Google AI Studio 的语音生成中直接使用 Gemini 3.8 Flash TTS 与 Flash-Lite TTS
- 在 Google AI Studio 的语音设计工作区中,用自然语言提示从零设计全新声音,或复刻你拥有权利使用的声音
- 把设计好的声音带入双人剧本编辑器,逐句指导台词的情感、节奏与方言,并添加垫话与人声细节
- 将声音保存以实现跨项目的一致表现,并把生成内容用于有声书、播客、游戏或实时语音代理等场景
常见问题
Gemini 3.8 Flash TTS 是什么?
Google 称 Gemini 3.8 Flash TTS 是 Gemini 家族的新文本转语音模型,面向深度创意指导与角色设计,可用自然语言从零创造新声音并逐句指导表演,支持 2,000 多个声音与 100 多种语言。
它和 Flash-Lite TTS 有什么区别?
Google 称 Gemini 3.8 Flash TTS 面向深度创意指导与角色设计,例如游戏、沉浸式有声书与播客;Gemini 3.8 Flash-Lite TTS 则面向高并发、成本高效的规模化配音、音频内容创作与表现力语音代理。
声音复刻是如何工作的?
Google 称声音复刻可从仅 30 秒的音频样本重建一致的声音轮廓,需提供与参考说话人匹配的口头同意录音,并配有内建同意验证、SynthID 水印与 C2PA 凭证;在 AI Studio 中的声音复刻不在伊利诺伊、得州、欧洲经济区、英国、瑞士与印度提供。
生成音频有什么安全保障?
Google 称所有由 Gemini Audio 模型生成的音频都带有 SynthID 不可感知水印,便于检测 AI 生成语音以防止错误信息,并在声音复刻中要求同意验证与 C2PA 凭证。
它在哪里可以使用?
Google 称 Gemini 3.8 Flash TTS 已在 Gemini API、Google AI Studio 与 Gemini Notebook 推出,Gemini Enterprise 将通过 API 提供;Gemini 3.8 Flash-Lite TTS 已在 Gemini API、Google AI Studio 与 Google Vids 推出。