Muse Realtime Voice 和 Muse Realtime Avatar 构成一个统一的流式架构,通过共享的语音 token 流将对话智能、语音和视频化身连接起来。
Muse Realtime Voice 生成同时编码内容和韵律的语音 token。Muse Realtime Avatar 消费这一共享流并生成流式视频。
通过使用固定长度的历史作为后续分块的运动上下文,系统在任意对话长度下保持有界计算,同时生成同步的语音、唇部动作和表情。
原题:Muse Realtime Voice and Muse Realtime Avatar form a unified streaming architecture connecting conversational intelligenc…
Meta 公布 Muse Realtime Voice 与 Muse Realtime Avatar,两者通过共享的语音 token 流组成统一流式架构。Voice 生成同时编码内容与韵律的语音 token,Avatar 消费同一 token 流生成流式视频。系统以固定长度历史作为后续分块的动作上下文,使任意长度对话下的计算量保持有界,并同步生成语音、唇动和表情。原文未披露模型规模、延迟数据与开放时间。
推荐理由做实时数字人或语音 Agent 的可以看这套共享 token 流的同步思路
Muse Realtime Voice 和 Muse Realtime Avatar 构成一个统一的流式架构,通过共享的语音 token 流将对话智能、语音和视频化身连接起来。
Muse Realtime Voice 生成同时编码内容和韵律的语音 token。Muse Realtime Avatar 消费这一共享流并生成流式视频。
通过使用固定长度的历史作为后续分块的运动上下文,系统在任意对话长度下保持有界计算,同时生成同步的语音、唇部动作和表情。
本文内容转载自 X @AIatMeta,由 AI(deepseek-chat)翻译整理,版权归原作者所有。
阅读原文 ↗ https://x.com/AIatMeta/status/2102997293448224985X @AIatMeta · 09/24 13:43 · 热度 2 · 已取全文
标题与摘要由 AI(deepseek-chat)改写,可能有误,以原文为准。