本发明公开了一种基于语谱图提取深度空间注意特征的语音情感识别方法,采用以下步骤完成:步骤a:对已标注指定情感标签的标准情感数据库中的语音进行预处理,生成语谱图;步骤b:将所述语谱图送入AItti模型提取SEF特征;步骤c:将所述语谱图送入语音情感模型提取浅层特征;步骤d:将所述SEF特征和所述浅层特征作为输入,送到CSWNet中,生成标定权重特征;步骤e:将所述标定权重特征送入CRNN之后的网络层,提取深度情感特征,通过Softmax分类器进行情感分类,生成最终分类结果。本发明所述方法相比于传统模型,在少量增加模型复杂度的前提下,平均识别率提升了8.43%,非同类情感区分效果明显,兼具良好的泛化性。
📄 2018115999079
📂 G10L15_02
👤 杭州电子科技大学
📅 2018-12-26
一种基于特征融合的语音情感识别方法,包括:步骤1)数据获取与预处理;步骤2)输入本发明中设计的基于特征融合的语音情感识别网络进行情感识别;步骤3)获得情感识别结果。本发明利用分类层特征融合的方法对语音情感进行识别,设计并实现了一种将MFCC(梅尔频率倒谱系数)的深层特征与传统的声学特征相融合的方法,用分类层特征融合算法将MFCC深层特征与过零率、梅尔频率、频谱质心进行融合,通过指定的决策融合规则对输出的识别结果进行融合计算,最后选择概率分布中概率最大的作为识别结果。该发明对语音情感识别,具有较大地应用价值。
📄 202210217251X
📂 G10L25_63
👤 浙江工业大学
📅 2022-03-07
一种语音情感识别装置,所述装置包括:获取单元,适于获取待处理的语音信号;预处理单元,适于对所获取的语音信号进行预处理,得到预处理后的语音信号;参数提取单元,适于提取预处理后的语音信号的特征参数;所述特征参数包括短时能量及其衍生参数、基音频率及其衍生参数、音质特征共振峰及其衍生参数、对MFCC求取的20阶的Mel倒谱系数和MFCC的一阶差分的最大值、MFCC的一阶差分最小值、MFCC的一阶差分的均值和MFCC的一阶差分的方差;采用所提取的特征参数组成对应的特征矢量序列,得到所述语音信号对应的特征矢量序列;识别单元,适于采用支持向量机对所述语音信号对应的特征矢量序列进行训练和识别,得到对应的语音情感识别结果。上述的方案,可以提高语音情感识别的准确率。
📄 2018104551641
📂 G10L25_03
👤 南京邮电大学
📅 2018-05-11
本发明公开了一种基于特征集融合的语音情感识别及评价方法,本发明利用Opensmile工具包提取IS09_emotion、IS10_paraling、IS11_speaker_state、IS12_speaker_trait四种语音情感特征集,建立Stacking集成学习模型,通过Stacking的初级学习器融合四种语音特征集,并通过Stacking的次级学习器建立最终的语音情感识别模型。实验结果表明在EMODB和RAVDESS这两种常见的语音数据库上,Stacking集成学习模型不仅关注单个语音情感特征集,同时可以融合不同语音情感特征集,进而达到更好的情感识别效果。
📄 2020105636521
📂 G10L25_63
👤 杭州电子科技大学
📅 2020-06-19
本发明公开了一种结合CGAN谱图去噪和双边滤波谱图增强的语音情感识别方法,包括:S1、获取干净语谱图以及加噪语谱图;S2、将干净语谱图和加噪语谱图输入基于矩阵距离的条件生成对抗网络进行训练,得到去噪模型;S3、利用去噪模型对加噪语谱图进行去噪处理,分别进行两个不同尺度的双边滤波,得到低、高尺度滤波图,低、高尺度滤波图相差再乘以增强系数,然后与低尺度滤波图相加,得到细节增强的语谱图;S4、将细节增强的语谱图输入卷积神经网络模型中进行分类,得到分类模型;S5、待识别语音的语谱图经过步骤S3中对语谱图的处理,得到的细节增强的语谱图输入分类模型,得到语音情感分类结果。本发明有效实现语音情感的识别。
📄 2020112284739
📂 G10L25_63
👤 杭州电子科技大学
📅 2020-11-06
本发明公开了一种基于特征融合与集成学习的语音情感分类方法,包括以下步骤:采集若干语音数据,并对语音数据进行预处理;对预处理后的数据进行特征提取,并构建特征集;采用多分类器构建集成学习分类模型,并对集成学习分类模型进行训练;采用训练后的集成学习分类模型对待识别语音数据对应特征集进行识别,获取分类结果,得到语音情感分类结果。本发明能够有效地通过语音数据对说话人的语音情感进行预测和分类。
📄 2021102097088
📂 G06K9_62
👤 西华大学
📅 2021-02-25
本发明涉及一种基于多级残差卷积神经网络的语音情感识别方法,属于语音信号分析和图像处理等技术领域。该方法包括:1)训练过程:收集并预处理带所有情感的声音信号,生成语谱图;然后构建多级残差卷积神经网络,并将语谱图输入到多级残差卷积神经网络进行训练;2)测试过程:获取并预处理待识别声音信号,生成待识别语谱图;然后将待识别语谱图输入到训练好的多级残差卷积神经网络,得到识别结果。本发明通过跨越多级的残差块对CNN进行特征弥补,解决了对CNN随着卷积层加深而出现的特征丢失的问题,且提高识别率。
📄 2020102257839
📂 G10L25_63
👤 重庆邮电大学
📅 2020-03-26
本发明涉及一种基于时空多重融合网络的变长语音情感识别方法,属于人工智能领域。该发明包括以下步骤:利用短时傅里叶变换和Mel滤波器组将语音映射为对数Mel滤波能量谱,并保持能量谱的原始长度;利用双向门控循环单元(Bidirectional gated recurrent unit,BiGRU)和注意力机制捕获能量谱的时域情感变化;利用卷积神经网络(Convolutional neuralnetwork,CNN)和全局平均池化定位能量谱的空域情感触发;利用直接连接和集成策略引入多重融合方法,用于能量谱时域与空域的情感交互;利用多分类交叉熵损失函数作为模型训练的指导,实现模型优化。本发明保持语音能量谱的长度不变,可对能量谱的时域与空域实现特征提取互不影响,并通过多重融合获得更完整的时空域情感信息,从而提升语音的情感识别精度。
📄 2022105548708
📂 G10L15_06
👤 重庆邮电大学
📅 2022-05-19
本发明属于深度学习中的语音信号处理领域,具体涉及一种基于深度学习的含噪语音情感识别方法,本方法首先将可学习的多特征进行融合作为模型的输入,提升模型任务相关的学习性能;其次引入混合声谱图分块的操作,并逐块的计算多头注意力用以捕获局部的情感信息,实验证明,分块操作可以有效的规避局部噪声带来的干扰问题;最后,本发明将逐帧计算注意力的全局上下文信息与局部情感信息加以融合,促进了模型对于上下文语义上的理解,提高了分类准确性。
📄 2022106197713
📂 G10L25_63
👤 重庆邮电大学
📅 2022-06-02