主语感知更强对齐
通过把文本中的主语单独解耦出来、与上下文分别和视觉特征交互,让跨模态对齐更明确,从而提升参考视频对象分割的准确度。
Gao, Mingqi · Yang, Jinyu · Han, Jungong · Lú, Ke · 郑锋 · Montana, Giovanni
IEEE Transactions on Circuits and Systems for Video Technology 2023
通过分别进行主语感知和上下文感知的交互,鼓励更具判别力的特征嵌入和对齐。
在所有 RVOS 基准数据集上的实验结果表明,该方法优于现有最先进方法。