一种基于融合注意力网络的多模态情感识别方法,提取文本、视觉和音频三个模态的高维特征并按字级对齐和归一化处理,然后输入至双向门控循环单元网络进行训练,提取三个单模态子网络中的双向门控循环单元网络输出的状态信息计算多模态间状态信息的相关度,再计算多个模态每一时刻的注意力分布,即每一时刻状态信息的权重参数,将三个模态子网络的状态信息和对应的权重参数加权平均得到融合特征向量作为全连接网络的输入,将待识别的文本、视觉和音频输入训练后各个模态的双向门控循环单元网络,得到最终的情感强度输出。本发明能克服多模态融合时各模态的权重一致性问题,提高多模态融合下的情感识别准确率。
📄 2019103240531
📂 G06F40_205
👤 浙江工业大学
📅 2019-04-22