AI Radar
清除条件
3
MarkTechPost13 小时前模型新模型发布海外

Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

Google 发布两款 Gemini Audio 系列语音模型:Gemini 3.8 Flash TTS 面向创意配音与角色设计,Flash-Lite TTS 面向高并发低成本生产,均通过 Gemini API 和 AI Studio 提供,仅 API 调用、不开源权重。新模型支持用自然语言逐句指导语气、节奏、方言,可从文本提示生成新音色,覆盖 100 多种语言和方言,并提供 2000+ 现成音色库。语音复刻需 30 秒样本和声音所有者口头同意录音,所有输出带 SynthID 水印。

推荐理由做配音、有声书或语音 Agent 的团队可直接换用,2000+ 音色库和逐句语气控制省去自建 TTS 的调参成本。

OpenRouter 公告15 小时前模型新模型发布海外2 个独立信源

NVIDIA 开源 100M 参数说话人分离模型 Nemotron 3

NVIDIA 在 Hugging Face 发布开源权重模型 Nemotron 3 Diarization,100M 参数,最多同时跟踪 8 位说话人,支持语音重叠场景,一个 checkpoint 同时覆盖离线录音与实时流式。权重采用 OpenMDW License 1.1,允许商用,通过 NVIDIA NeMo 在 Linux 上运行,支持 Ampere、Ada Lovelace、Hopper、Blackwell GPU。相比此前支持 4 人的 Streaming Sortformer,说话人上限翻倍。模型接收 …

推荐理由做会议转写、通话分析或语音 Agent 记忆的,可直接拿权重商用,8 人重叠场景有现成方案

The Decoder15 小时前模型产品发布/更新海外2 个独立信源

ChatGPT Voice 升级:接入邮件、日历和 Slack

ChatGPT Voice 迎来重大升级,全球可用,底层换成 OpenAI 新的 GPT-6 Astra、Sol 和 Luna 模型,并首次能调用邮件、日历、Slack 等插件。用户可直接用语音查日历、发邮件、让 ChatGPT 发现并取消财务应用里的重复扣款,甚至搭建带结账页的网站。语音功能也进入网页和移动端的 ChatGPT Work,说话即可生成文档、演示文稿和表格,最新版应用已上线。OpenAI 称这是迈向《Her》式日常 AI 助手的一步,但也承认伴随风险。

推荐理由语音现在能直接操作邮件、日历和 Slack,查日程、发邮件、搭网页都能一句话完成,已随最新版应用上线。