多模态情感特权嵌入网络
仅用图像提升识别
通过将音频与文本情感信息作为特权信息嵌入训练,该网络在测试时仅需面部图像即可实现更准确的表情识别。
孙宁 · Changwei, You · 郑文明 · Liu, Jixin · Chai, Lei · Sun, Haian
IEEE Transactions on Affective Computing 2024
参数信息
- 识别准确率(RAF-DB)
- 92.13 %
- 识别准确率(AffectNet)
- 64.91 %
技术优势
推理无需额外模态
测试阶段只需面部图像,无需音频或文本输入,降低了部署的传感器要求。
超越多模态融合
仅用图像推理即可取得比使用多模态情感数据融合的方法更好的结果。
应对数据不足
多阶段训练策略(逐模块预训练后端到端微调)使得在有限训练样本下也能有效训练大规模异构网络。
应用场景
- 情感计算:仅用图像识别表情,无需多模态传感器,便于在现有设备上实现情感分析。
- 智能人机交互:实时从摄像头图像判断用户情绪,提升交互系统的响应自然度。
- 情感机器人:机器人仅靠视觉即可感知人的表情并作出情感回应,无需佩戴式传感器。
- 驾驶员状态监测:通过车载摄像头识别驾驶员表情,辅助判断疲劳或情绪状态,无需额外模态。
- 服务机器人:服务机器人利用表情识别理解用户满意度,仅需摄像头即可实现。