跨模态语义融合
该网络通过在不同层级聚合单模态专家的语义知识,实现更全面的跨模态对齐与融合,显著提升视觉-语言表征能力。
徐晓 · Li, Bei · Chenfei, Wu · Tseng, Shao Yen · Anahita, Bhiwandiwalla · Shachar, Rosenman · Lal, Vasudev · Che, Wangxiang · 段楠
2023
在每个跨模态层引入管理器,自适应聚合来自不同层级单模态专家的语义知识,使对齐和融合更加全面。
仅用 4M 预训练数据,在多个下游视觉-语言任务上取得优越性能,尤其在 VQAv2 和 Flickr30K 上表现突出。