多模态情感识别
通过多视角融合文本、音频和视频信息,捕捉对话中的动态交互和长期依赖,提升情感识别的准确性。
Wen, Jintao · 姜大志 · Tu, Geng · 刘诚 · Cambria, Erik
Information Fusion 2023
通过多视图注意力层挖掘不同模态组合之间的动态依赖,使模型能发现文本、音频和视频间的交互信息。
使用时间卷积网络合成个体上下文,并用门控循环单元和记忆网络建模全局会话,捕获多轮多说话者的长期依赖。