运动引导令牌优先级跨视角视频生成模型

无目标视角线索仍精准生成

与外视-自视跨视角视频生成现有方法相比,该模型通过运动引导的令牌优先级排序和语义降级融合,在不依赖目标视角线索的情况下实现了更优的时空一致性和语义准确性。

Hu, Weipeng · Jiun Tian, Hoe · Runzhong, Zhang · 杨一鸣 · 胡海峰 · Tan, Yap-Peng

Information Fusion 2025

技术优势

无需目标视角线索

在生成过程中不依赖任何目标视角的先验线索,可直接从外视视频推理出自视内容,扩展了应用场景。

利用运动线索提升注意力

通过运动引导的空间和时间令牌优先级Transformer自适应地识别信息性令牌,确保准确的注意力检索和跨视角生成的时空一致性。

渐进学习自视语义

语义退化融合通过退化学习机制逐步学习自视语义,使模型能够推断自视内容。

级联架构融合多粒度信息

通过级联方式扩展,利用信息令牌增强注意力学习,并在不同粒度层次融合自视语义。

应用场景