Muse Realtime Voice 和 Muse Realtime Avatar 构成一个统一的流式架构,通过共享的语音 token 流将对话智能、语音和视频化身连接起来。

Muse Realtime Voice 生成同时编码内容和韵律的语音 token。Muse Realtime Avatar 消费这一共享流并生成流式视频。

通过使用固定长度的历史作为后续分块的运动上下文,系统在任意对话长度下保持有界计算,同时生成同步的语音、唇部动作和表情。