检测精度全面提升
通过同时学习三元组内部视觉与文本线索以及跨三元组共生与布局关系,提升人-物交互检测性能。
任卫红 · Jinguo, Luo · Jiang, Weibo · Qu, Liangqiong · 韩志 · 田建东 · 刘洪海
IEEE Transactions on Circuits and Systems for Video Technology 2024
在两个基准上均优于现有方法,HICO-DET 上 40.32 mAP,V-COCO 上 69.1 mAP。
通过引入跨三元组上下文交换,弥补了仅用自三元组聚合的不足,使特征表示更具判别力。
在自三元组聚合中,将视觉交互特征和文本先验知识作为两种不同的边,实现多模态信息融合。