多级聚合对齐网络

跨模态语义融合

该网络通过在不同层级聚合单模态专家的语义知识,实现更全面的跨模态对齐与融合,显著提升视觉-语言表征能力。

徐晓 · Li, Bei · Chenfei, Wu · Tseng, Shao Yen · Anahita, Bhiwandiwalla · Shachar, Rosenman · Lal, Vasudev · Che, Wangxiang · 段楠

2023

参数信息

VQAv2 Test-Std 准确率
79.15 %
Flickr30K 文本检索 R@1
95.64 %

技术优势

跨模态对齐更全面

在每个跨模态层引入管理器,自适应聚合来自不同层级单模态专家的语义知识,使对齐和融合更加全面。

少数据也能打

仅用 4M 预训练数据,在多个下游视觉-语言任务上取得优越性能,尤其在 VQAv2 和 Flickr30K 上表现突出。

应用场景