实时视频流需要即时响应,同时在长时间对话中保持视觉一致性。
我们通过将一个带有 3-way CFG 的大型 40 步扩散教师模型(每个视频块 120 次评估)蒸馏为一个无引导的 2 步因果学生模型,并配备固定长度的 KV 缓存,实现了这一目标。
自强制(self-forcing)帮助学生模型抵抗漂移,在评估次数减少 60 倍的情况下保持接近教师模型的质量。
原题:Live video streaming needs to respond instantly while remaining visually consistent over long conversations.
Meta AI 公布实时视频流生成方案:将带 3-way CFG、每个视频块需 120 次评估的 40 步扩散教师模型,蒸馏为无引导的 2 步因果学生模型,并使用固定长度 KV cache。借助 self-forcing,学生模型能抵抗长对话中的漂移,在评估次数减少 60 倍的情况下保持接近教师模型的质量。原文未披露具体模型名称、评测数据集和延迟数据。
推荐理由做实时视频生成的人可以记下这条路线:2 步因果学生 + 固定 KV cache,评估次数砍到 1/60
实时视频流需要即时响应,同时在长时间对话中保持视觉一致性。
我们通过将一个带有 3-way CFG 的大型 40 步扩散教师模型(每个视频块 120 次评估)蒸馏为一个无引导的 2 步因果学生模型,并配备固定长度的 KV 缓存,实现了这一目标。
自强制(self-forcing)帮助学生模型抵抗漂移,在评估次数减少 60 倍的情况下保持接近教师模型的质量。
本文内容转载自 X @AIatMeta,由 AI(deepseek-chat)翻译整理,版权归原作者所有。
阅读原文 ↗ https://x.com/AIatMeta/status/2102997295222432093X @AIatMeta · 09/24 13:43 · 热度 3 · 已取全文
标题与摘要由 AI(deepseek-chat)改写,可能有误,以原文为准。