Google 发布了 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,这是其 Gemini Audio 家族中的 2 款新文本转语音模型。Google 称它们是迄今为止最具表现力的音频生成模型。Flash TTS 面向创意指导和角色配音。Flash-Lite TTS 面向大批量、高性价比的生产。两者都允许开发者使用自然语言逐行指导演绎方式。

它可部署吗?可以,两款模型目前正通过 Gemini API 和 Google AI Studio 逐步推出。仅提供 API 访问,没有可用于自托管的开源权重。通过 Gemini Enterprise 提供的企业 API 访问被列为即将推出。

Google 发布了什么

此次发布将 TTS 分为 2 个层级,并共享指导控制功能:

Gemini 3.8 Flash TTS 专为深度创意指导和角色设计而打造。目标用途包括游戏、沉浸式有声书、播客和互动媒体。它提供对表演提示、节奏、方言切换和附和语的精细控制。

Gemini 3.8 Flash-Lite TTS 专为大批量、高性价比的规模化场景而打造。Google 将其定位用于配音、音频内容创作和富有表现力的语音智能体。它提供对语气、节奏和表现力细微差别的细粒度控制。

在 AI Studio 中,playground 链接使用模型标识符 gemini-3.8-flash-tts 和 gemini-3.8-flash-lite-tts。

通过文本提示进行语音设计

此前的 Gemini TTS 提供 30 种原创语音。3.8 版本转向了一个大得多的语音系统。

生成式语音设计:Flash TTS 根据描述角色、口音和声音特征的提示创建新语音。这适用于 100 多种语言和方言。Google 的演示包括一位墨尔本 DJ、一个单调的机器人和一条日本龙。

语音库:开发者可获得 2,000+ 种可直接用于生产的语音。覆盖范围包括墨西哥西班牙语、魁北克法语和苏格兰英语等地区变体。

保存与扩展:自定义语音可以保存并重复使用,跨项目漂移极小。

语音混音(即将推出):用户将能够通过提示调整语音库中某个语音的音色、音高、节奏和口音。

指导表演

两款模型都接受写在脚本中的舞台指示。Gemini 也可以根据自然脚本线索来引导演绎方式。

长文本生成:语音质量、节奏和音色在数小时的连续音频中保持稳定。

原生双说话人编排:单个脚本即可驱动多轮对话,声音清晰且彼此分离。

人声爆发音:<laughs>、<sigh> 和 <gasp> 等非语言提示音增添对话质感。

附和应答:|mhm| 和 |yeah| 等主动倾听式插话可控制反应节拍和喜剧时机。

声音复制与安全控制

声音复制基于 30 秒音频样本构建一致的声纹档案。样本必须是你的声音或你拥有使用权利的声音。复制需要声音所有者录制一段口头同意录音,并与参考说话人进行匹配。

Gemini Audio 模型的每个片段都带有 SynthID 水印。这一不可察觉的标记直接嵌入音频输出中。复制的声音还带有 C2PA 内容凭证。Google 指向 Gemini 3.8 Audio 模型卡以了解其更广泛的安全方案。

基准测试结果

Google 报告了新模型的以下结果:

Hume AI 声音设计基准测试:据 Hume AI 称,Flash TTS 以 71.4 分总体排名第 1。

口音建模:Flash TTS 以 60.8 分领先。

Hume AI 总体质量指数:Flash TTS 排名第 1,Flash-Lite TTS 排名第 2。

Voice Arena 盲测偏好:两款模型在日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语中均位居前列。

关键要点

Google 推出了面向创意工作的 Gemini 3.8 Flash TTS 和面向规模化应用的 Flash-Lite TTS。

Flash TTS 可通过提示词设计覆盖 100 多种语言和方言的新声音。

开发者可使用 2,000 多种生产级声音,较最初的 30 种大幅增加。

声音复制需要 30 秒样本以及匹配的同意录音。

Flash TTS 以 71.4 分在 Hume AI 的声音设计基准测试中排名第 1。

常见问题

什么是 Gemini 3.8 Flash TTS?它是 Google 的文本转语音模型,用于创意声音设计和逐行表演指导。可通过 Gemini API 和 Google AI Studio 使用。

Flash-Lite TTS 有何不同?Flash-Lite TTS 针对配音和语音智能体等大批量、高成本效益的工作负载进行了优化。它在 Hume AI 的总体质量指数中排名第 2。

我可以克隆自己的声音吗?可以,只需 30 秒的样本和一段口头同意录音。该功能在 AI Studio 中于多个地区不可用,包括英国、欧洲经济区和印度。

查看技术博客。所有功劳都归于本项目的研究人员。另外,欢迎在 Twitter 上关注我们,别忘了加入我们拥有 15 万+ 成员的 ML SubReddit 并订阅我们的新闻通讯。等等!你在用 Telegram 吗?现在你也可以在 Telegram 上加入我们了。

需要与我们合作推广你的 GitHub Repo 或 Hugging Face 页面或产品发布或网络研讨会等?联系我们

文章 Google Releases Gemini 3.8 Flash TTS and Flash-Lite TTS With Prompt-Based Voice Design 首发于 MarkTechPost。