RiVEG多模态实体识别框架

通用框架统一三类任务

结合LLM重构与框式分割,统一实体识别、视觉定位与分割,解决图文弱关联与粒度不一致问题。

Jinyuan, Li · Ziyan, Li · Han, Li · 俞建飞 · 夏睿 · Sun, Di · 潘刚

IEEE Transactions on Multimedia 2026

技术优势

无需预提取区域特征

通过LLM重构将MNER、VE、VG联合建模,不再依赖目标检测器预提取区域特征。