多模态情感特权嵌入网络

仅用图像提升识别

通过将音频与文本情感信息作为特权信息嵌入训练,该网络在测试时仅需面部图像即可实现更准确的表情识别。

孙宁 · Changwei, You · 郑文明 · Liu, Jixin · Chai, Lei · Sun, Haian

IEEE Transactions on Affective Computing 2024

参数信息

识别准确率(RAF-DB)
92.13 %
识别准确率(AffectNet)
64.91 %

技术优势

推理无需额外模态

测试阶段只需面部图像,无需音频或文本输入,降低了部署的传感器要求。

超越多模态融合

仅用图像推理即可取得比使用多模态情感数据融合的方法更好的结果。

应对数据不足

多阶段训练策略(逐模块预训练后端到端微调)使得在有限训练样本下也能有效训练大规模异构网络。

应用场景