论文链接:https://arxiv.org/pdf/2509.25161
项目链接:https://kunhao-liu.github.io/Rolling_Forcing_Webpage/

亮点直击
一种滚动窗口联合去噪技术,该技术在单次前向传递中处理多个帧,实现了相互优化,同时保持了实时延迟。 在流视频生成任务中引入了注意力汇机制,这是一项开创性的工作,使得可以将初始帧缓存为一致的全局上下文,从而在视频生成中实现长期一致性。 设计了一种高效的训练算法,该算法在非重叠窗口上运行,并以自生成历史为条件,使得在扩展的去噪窗口上进行少步蒸馏成为可能,同时减轻了曝光偏差。
总结速览
解决的问题
流视频生成中存在的误差累积问题,导致长时间生成的视频流质量下降。
提出的方案
设计了Rolling Forcing技术,通过创新的去噪和注意力机制,最小化误差累积。
应用的技术
联合去噪方案:同时对多个帧进行去噪,逐步增加噪声水平,放宽相邻帧的严格因果关系。 注意力汇机制:引入全局上下文锚点,利用初始帧的关键值状态,增强全局一致性。 高效训练算法:在非重叠窗口上进行少步蒸馏,减轻曝光偏差。
达到的效果
在单个GPU上实现长达数分钟视频的实时流生成,显著减少误差累积,提升视频质量和一致性。
方法
预备知识:自回归视频扩散模型中的曝光偏差


通过滚动扩散窗口实现自回归视频生成



时间和全局历史上下文

滚动强制后训练




实验
实现细节

比较
我们将滚动强制与几个相关的、规模相当的开源视频生成模型进行比较。具体来说,SkyReels-V2(Chen 等,2025)在扩散强制范式下进行训练,该范式在推理过程中破坏历史帧以减轻误差累积。MAGI-1 在训练和推理中均采用 FIFO 式去噪范式。我们还与先前的基于蒸馏的方法进行比较,包括 CausVid 和自我强制。需要注意的是,SkyReelsV2、CausVid、自我强制和我们的滚动强制均从相同的基础模型 Wan2.1-T2V-1.3B 初始化。


消融研究
进行了消融研究,以评估几种设计选项的贡献,如下表 2 所总结。

滚动扩散窗口。评估了两个变体:无 RF 推理(w/o RF inference)和无 RF 训练(w/o RF training)。在无 RF 推理中,移除了滚动去噪窗口,并在推理过程中采用逐帧去噪,同时保持与我们完整方法相同的训练过程和模型权重。在无 RF 训练中,模型完全在逐帧范式下进行训练和推理。如下图 5 所示,这两个变体在 30 秒内都遭遇了明显的误差累积,表明滚动窗口对于抑制长期漂移至关重要。

混合训练策略。为了评估其效果,移除了自我强制训练目标(w/o SF training)。如上表 2 所示,这导致了一致性和整体质量的显著下降,主要是由于不自然的摄像机运动。
注意力陷阱。最后,移除全局上下文帧(w/o attention sink)导致生成视频中出现明显的漂移,如上图 5 所示。
结论
Rolling Forcing,这是一种用于实时长时视频生成的框架,能够在维持亚秒级延迟的同时减轻误差累积。通过引入滚动窗口联合去噪策略,Rolling Forcing 使得连续帧之间能够进行相互优化,有效减少长期漂移。注意力汇机制的整合进一步通过将初始帧作为持久上下文锚定来增强全局一致性,而我们高效的训练算法则在扩展的去噪窗口上实现了少步蒸馏,同时减轻了曝光偏差。大量实验表明,Rolling Forcing 在长达数分钟流序列中实现了最先进的时间一致性和视觉保真度,在质量和效率上显著优于先前的流媒体方法。
参考文献
[1] ROLLING FORCING: AUTOREGRESSIVE LONG VIDEO DIFFUSION IN REAL TIME
