文字即出高清视频
基于潜扩散模型级联的文本到视频生成框架,通过时间自注意力和图像-视频联合微调,生成高质量且富有创造力的视频。
Wang, Yaohui · Chen, Xinyuan · Xin, Ma · Zhou, Shangchen · Huang, Ziqi · Yi, Wang · Yang, Ceyuan · He, Yinan · Jiashuo, Yu · Peiqing, Yang · 郭雨薇 · Tianxing, Wu · Si, Chenyang · Jiang, Yuming · Chen, Cunjian · Loy, Chen Change · Dai, Bo · Lin, Dahua · Qiao, Yu · Liu, Ziwei
International Journal of Computer Vision 2024
简单的时序自注意力加上旋转位置编码即可捕捉视频的时间相关性,而图像-视频联合微调保证了生成结果的高质量和强创造性。
由一个基础 T2V 模型、一个时间插值模型和一个视频超分辨率模型级联而成,分工生成高分辨率视频。
贡献了 2500 万高质量、多样化、美观的文本-视频对数据集 Vimeo25M,用于训练提升性能。