多模态槽填充模型

图文融合填值

联合商品图文信息分别填充图像依赖与文本依赖属性,利用视觉显著性归因策略,更精准地补全商品属性值。

Jia, Meihuizi · Lei, Shen · Anh Tuan, Luu · Chen, Meng · Jing, Xu · 廖乐健 · Yuan, Shaozu · Xiaodong, He

IEEE Transactions on Multimedia 2024

技术优势

细粒度视觉挖掘

通过可视化显著性归因区分图像依赖与文本依赖属性,从而针对性地利用图像信息。

图文联合建模

模型结合多模态表示,对图像依赖和文本依赖属性分别填充,从而更精准地预测属性值。

应用场景