Google 推出 Gemini 3.8 Flash TTS 和 Flash-Lite TTS,两款用于语音生成的新模型。Flash TTS 可以根据文本描述创建新语音,两款模型均支持 100 多种语言,并允许用户为单句对话添加舞台指示。

据 Google 介绍,Gemini 3.8 Flash TTS 面向游戏角色、有声书和播客等创意项目,而 Gemini 3.8 Flash-Lite TTS 则专注于面向配音、音频内容和语音智能体的低成本大规模语音生成。

Flash TTS 让用户可以根据文本描述创建语音

借助 Gemini 3.8 Flash TTS,用户可以从零开始设计语音。据 Google 介绍,一段文本提示可以定义语音的角色、口音和声音特征,并覆盖多种语言和方言。对于不想从零开始的用户,Google 提供了包含 2000 多种预设语音的库,其中包括墨西哥西班牙语、魁北克法语和苏格兰英语等地区变体。

语音克隆功能可以通过一段 30 秒的音频样本构建语音档案。使用该功能时,被克隆声音的人必须录制一段口头同意声明,且该录音中的声音必须与样本匹配。Gemini 音频模型生成的每一段音频都带有不可听的SynthID 水印以帮助检测 AI 生成的语音,据 Google 称

Google 还宣布了“语音混音”(Voice Remixing)功能,该功能将允许用户调整语音库中语音的音色、音高、节奏和口音,但目前尚未上线。

脚本指示让用户可以控制对话和表达方式

两款模型都允许用户为每一句台词编写指示,或让模型自行解读脚本提示。Google 表示,这些模型可以生成数小时的音频,而“说话人漂移”极小,也就是说声音随时间几乎没有变化。

据该公司介绍,双语音模式可以从单一脚本生成对话,同时保持两个声音彼此区分。用户还可以在脚本中加入笑声、叹息以及“mhm”之类的声音,从而把反应和停顿精确放置在想要的位置。

在我自己的两次测试中,我使用了一个预设语音,并配上一段风格提示,要求它模仿一个恼火的柏林人,用浓重德国口音说英语。风格控制产生了令人信服的口音和语调,但两次测试在某些时段背景里都有高频啸叫。其中一次,语音在片段结尾还发生了变化。


风格提示:一个来自柏林的德国本地男性,把英语作为外语来说,带有浓重、 unmistakable 的德国口音。他显然不是英语母语者:他按德语方式发音英语单词,把德语的节奏和语调套用到英语句子上。“Th”变成“z”或“d”(“ze”、“sink”、“dat”),“w”变成“v”(“vat”、“vell”),词尾辅音变得更硬(“goot”,用“bat”代替“bad”)。“r”是喉音、沙哑的,绝不是英语的“r”。元音扁平而短促,缺少美式或英式英语中的柔和感。

声音带鼻音,略显紧绷,处于中音区,带有沙哑的颤抖和类似 Kermit 的晃动,但更粗粝,不那么像木偶。听起来像凌晨 2 点疲惫的柏林人。

表达方式:快速、短促、断续。他在寻找英语单词时会短暂犹豫,有时会平淡地插入德语词而不翻译。偶尔出现恼怒的上扬音调。干巴巴、讥讽、不为所动,并且有点恼火自己居然还得解释任何事情——更恼火的是还得用英语解释。

Google 表示,其新模型在 Hume AI 文本转语音基准测试的大多数类别中领先。| 图片:Google

Google 开始推出这两款模型,企业 API 访问将随后跟进

Google 正在通过以下渠道推出这两款模型:Gemini APIGoogle AI Studio。Flash TTS 也可在Gemini Notebook中使用,而 Flash-Lite TTS 则可在 Google Vids 中使用。Google 表示,通过Gemini Enterprise API的访问将很快对这两款模型开放。

包括AgoraLiveKitPipecatVercel在内的开发者平台已支持通过 Gemini API 集成。Google 尚未列出新模型的区域端点,不过较早的 TTS 模型曾提供欧盟数据处理

根据 Google 的说法,免费层级的数据会被用于改进其产品,而付费层级的数据则不会。付费定价以每百万 token 美元计价,文本 token 按输入计费,音频 token 按输出计费。

计费 Flash TTS(截至 2026 年底) Flash TTS(2027 年起) Flash-Lite TTS(截至 2026 年底) Flash-Lite TTS(2027 年起)
文本输入 $0.50 $1.00 $0.50 $1.00
音频输出 $9.00 $18.00 $6.00 $12.00

Google 表示,1 秒生成的音频等于 25 个音频 token,因此 1 小时为 90,000 个 token。这意味着截至 2026 年底,使用 Flash TTS 时 1 小时音频输出费用为 $0.81,使用 Flash-Lite TTS 时为 $0.54。2027 年 1 月 1 日,这些费用将上涨至 $1.62 和 $1.08,文本输入单独计费。

没有炒作的 AI 新闻——由人类精选

订阅 THE DECODER,享受无广告阅读、每周 AI 新闻简报、我们每年六期的独家“AI Radar”前沿报告、完整档案访问权限,以及评论区访问权限。

立即订阅