文本视频对齐更准
让空间与时序特征在3D窗口内互相增强,减少视频生成的时序扭曲与文本错位。
王文静 · Yang, Huan · Zixi, Tuo · Huiguo, He · Zhu, Junchen · 傅建龙 · Liu, Jia-Ying
International Journal of Computer Vision 2025
空间与时间特征在3D窗口内交互,避免独立建模时间维度导致的动作与语义错位。
交换式交叉注意力让文本条件更直接地引导时序生成,生成的视频动作和内容与指令更一致。
HD-VG-130M提供1.3亿高清无水印的开放域文本-视频对,可直接用于训练高质量视频生成模型。