多视图记忆网络

多模态情感识别

通过多视角融合文本、音频和视频信息,捕捉对话中的动态交互和长期依赖,提升情感识别的准确性。

Wen, Jintao · 姜大志 · Tu, Geng · 刘诚 · Cambria, Erik

Information Fusion 2023

参数信息

IEMOCAP 准确率
64.7 %
MELD 准确率
60.6 %

技术优势

跨模态动态融合

通过多视图注意力层挖掘不同模态组合之间的动态依赖,使模型能发现文本、音频和视频间的交互信息。

长期上下文建模

使用时间卷积网络合成个体上下文,并用门控循环单元和记忆网络建模全局会话,捕获多轮多说话者的长期依赖。

应用场景