自-跨三元组上下文网络

检测精度全面提升

通过同时学习三元组内部视觉与文本线索以及跨三元组共生与布局关系,提升人-物交互检测性能。

任卫红 · Jinguo, Luo · Jiang, Weibo · Qu, Liangqiong · 韩志 · 田建东 · 刘洪海

IEEE Transactions on Circuits and Systems for Video Technology 2024

参数信息

平均精度
40.32 mAP
平均精度
69.1 mAP

技术优势

精度超越现有方法

在两个基准上均优于现有方法,HICO-DET 上 40.32 mAP,V-COCO 上 69.1 mAP。

缓解学习歧义

通过引入跨三元组上下文交换,弥补了仅用自三元组聚合的不足,使特征表示更具判别力。

视觉与文本线索融合

在自三元组聚合中,将视觉交互特征和文本先验知识作为两种不同的边,实现多模态信息融合。

应用场景