实时视频流需要即时响应,同时在长时间对话中保持视觉一致性。

我们通过将一个带有 3-way CFG 的大型 40 步扩散教师模型(每个视频块 120 次评估)蒸馏为一个无引导的 2 步因果学生模型,并配备固定长度的 KV 缓存,实现了这一目标。

自强制(self-forcing)帮助学生模型抵抗漂移,在评估次数减少 60 倍的情况下保持接近教师模型的质量。