解耦式多模态变换器

主语感知更强对齐

通过把文本中的主语单独解耦出来、与上下文分别和视觉特征交互,让跨模态对齐更明确,从而提升参考视频对象分割的准确度。

Gao, Mingqi · Yang, Jinyu · Han, Jungong · Lú, Ke · 郑锋 · Montana, Giovanni

IEEE Transactions on Circuits and Systems for Video Technology 2023

技术优势

对齐更明确

通过分别进行主语感知和上下文感知的交互,鼓励更具判别力的特征嵌入和对齐。

性能最优

在所有 RVOS 基准数据集上的实验结果表明,该方法优于现有最先进方法。

应用场景