时序一致视频生成
该扩散模型首次同时引入短时卷积与长时注意力,在保证时序一致性的同时大幅降低内存占用,并支持迭代生成长视频。
Zhao, Haoyu · Gu, Jiaxi · Shicong, Wang · 陆天怡 · 张杏 · 吴祖煊 · Xu, Hang · Jiang, Yugang
IEEE Transactions on Multimedia 2026
短时卷积学习局部时序特征,长时注意力捕捉复杂运动的长程依赖,两者结合确保生成视频的时序一致性。
长时注意力采用新的内存高效机制,避免标准时序注意力的高内存开销。
即使训练数据量减少26.5倍,仍能保持优越的零样本推理性能。
提出迭代推理方法,能够逐步生成数百帧的长视频。