多模态F1提升1.55%
HGR模型通过Vision Refine和Graph Cross Inference模块挖掘图像对象与文本实体间的潜在配对投影,利用视觉信息辅助文本实体抽取,在四个多模态数据集上验证有效。
Wang, Xinzhi · 朱能军 · 李加好 · Chang, Yudong · Zhennan, Li
Machine Learning 2024