MarkTechPost12 小时前模型新模型发布海外Google 发布两款 Gemini Audio 系列语音模型:Gemini 3.8 Flash TTS 面向创意配音与角色设计,Flash-Lite TTS 面向高并发低成本生产,均通过 Gemini API 和 AI Studio 提供,仅 API 调用、不开源权重。新模型支持用自然语言逐句指导语气、节奏、方言,可从文本提示生成新音色,覆盖 100 多种语言和方言,并提供 2000+ 现成音色库。语音复刻需 30 秒样本和声音所有者口头同意录音,所有输出带 SynthID 水印。
推荐理由做配音、有声书或语音 Agent 的团队可直接换用,2000+ 音色库和逐句语气控制省去自建 TTS 的调参成本。
OpenRouter 公告14 小时前模型新模型发布海外2 个独立信源NVIDIA 在 Hugging Face 发布开源权重模型 Nemotron 3 Diarization,100M 参数,最多同时跟踪 8 位说话人,支持语音重叠场景,一个 checkpoint 同时覆盖离线录音与实时流式。权重采用 OpenMDW License 1.1,允许商用,通过 NVIDIA NeMo 在 Linux 上运行,支持 Ampere、Ada Lovelace、Hopper、Blackwell GPU。相比此前支持 4 人的 Streaming Sortformer,说话人上限翻倍。模型接收 …
推荐理由做会议转写、通话分析或语音 Agent 记忆的,可直接拿权重商用,8 人重叠场景有现成方案
The Decoder15 小时前模型产品发布/更新海外2 个独立信源ChatGPT Voice 迎来重大升级,全球可用,底层换成 OpenAI 新的 GPT-6 Astra、Sol 和 Luna 模型,并首次能调用邮件、日历、Slack 等插件。用户可直接用语音查日历、发邮件、让 ChatGPT 发现并取消财务应用里的重复扣款,甚至搭建带结账页的网站。语音功能也进入网页和移动端的 ChatGPT Work,说话即可生成文档、演示文稿和表格,最新版应用已上线。OpenAI 称这是迈向《Her》式日常 AI 助手的一步,但也承认伴随风险。
推荐理由语音现在能直接操作邮件、日历和 Slack,查日程、发邮件、搭网页都能一句话完成,已随最新版应用上线。
The Decoder15 小时前资讯新模型发布海外Google 推出 Gemini 3.8 Flash TTS 和 Flash-Lite TTS 两款语音生成模型。Flash TTS 支持用文字提示定义音色的角色、口音和声线特征,内置 2000 多种预设音色(含墨西哥西班牙语、魁北克法语、苏格兰英语等地区变体),支持 100 多种语言;用 30 秒音频样本即可克隆音色,但需被克隆者录制同意声明。两款模型均支持逐句舞台指示、双人对话模式,可生成数小时音频且说话人漂移极小。Flash-Lite 面向配音、音频内容和语音 Agent 的低成本规模化场景。所有生成音频带 …
推荐理由做语音 Agent 或配音的可以看:2000+ 预设音色、30 秒克隆、100+ 语言,还有实测暴露的杂音问题