多模态表情识别网络

文本语义增强特征

结合视觉Transformer与文本语义监督,实现野外场景下高准确率的面部表情识别。

Li, Yande · 王明杰 · 龚明伦 · 路永钢 · 刘礼

IEEE Transactions on Multimedia 2024

技术优势

扩大感受野

通过串联CNN与Transformer的混合特征提取,同时捕获局部细节与全局上下文。

引入文本监督

利用图像-文本特征相似度融入语义关联,增强图像特征表征能力。

超越现有方法

在多个公开基准测试上取得优于现有最先进方法的性能。

应用场景