Meta 把 40 步扩散模型蒸馏成 2 步,推理开销降 60 倍
Meta AI 公布实时视频流生成方案:将带 3-way CFG、每个视频块需 120 次评估的 40 步扩散教师模型,蒸馏为无引导的 2 步因果学生模型,并使用固定长度 KV cache。借助 self-forcing,学生模型能抵抗长对话中的漂移,在评估次数减少 60 倍的情况下保持接近教师模型的质量。原文未披露具体模型名称、评测数据集和延迟数据。
推荐理由做实时视频生成的人可以记下这条路线:2 步因果学生 + 固定 KV cache,评估次数砍到 1/60