跨模态情绪提示网络

情绪概念引导视觉适配

将情绪文本语义直接注入面部外观图像,强化对表情相关细节的全面精确理解。

Haoliang, Zhou · 黄树成 · 张飞飞 · 徐常胜

IEEE Transactions on Circuits and Systems for Video Technology 2024

技术优势

捕捉类别特定外观

通过情绪概念引导的视觉适配器,使VLP模型对与表情相关的视觉差异更敏感。

避免灾难性遗忘

采用知识蒸馏防止模型遗忘预训练中学到的类别不变知识。

促进多模态信息交互

通过概念-外观调谐器(CAT)在情绪概念和外观提示之间协同调谐,促进多模态信息的交互。

应用场景