交换注意力时空扩散模型

文本视频对齐更准

让空间与时序特征在3D窗口内互相增强,减少视频生成的时序扭曲与文本错位。

王文静 · Yang, Huan · Zixi, Tuo · Huiguo, He · Zhu, Junchen · 傅建龙 · Liu, Jia-Ying

International Journal of Computer Vision 2025

参数信息

HD-VG-130M数据集规模
130 million

技术优势

时序扭曲更少

空间与时间特征在3D窗口内交互,避免独立建模时间维度导致的动作与语义错位。

文本对齐更准

交换式交叉注意力让文本条件更直接地引导时序生成,生成的视频动作和内容与指令更一致。

有开源大数据集可练

HD-VG-130M提供1.3亿高清无水印的开放域文本-视频对,可直接用于训练高质量视频生成模型。

应用场景