视频与运动联合预测
统一建模航拍视频帧与目标运动状态,通过时空解耦注意力与信息共享机制,同时提升场景预测和目标运动预测精度。
Liangyu, Xu · Lu, Wanxuan · Yu, Hongfeng · Mao, Yongqiang · Hanbo, Bi · Liu, Chenglong · 孙显 · 付琨
IEEE Transactions on Geoscience and Remote Sensing 2024
一个模型同时输出未来视频帧和目标运动状态,无需为运动估计单独训练模型,减少部署复杂度。
空间静态注意力与时间动态注意力分开建模,分别捕捉场景外观和运动模式,避免相互干扰。
通过两组信使令牌在视频和目标运动之间进行信息交互,让目标运动预测受益于场景上下文。