本发明公开了一种基于语谱图提取深度空间注意特征的语音情感识别方法,采用以下步骤完成:步骤a:对已标注指定情感标签的标准情感数据库中的语音进行预处理,生成语谱图;步骤b:将所述语谱图送入AItti模型提取SEF特征;步骤c:将所述语谱图送入语音情感模型提取浅层特征;步骤d:将所述SEF特征和所述浅层特征作为输入,送到CSWNet中,生成标定权重特征;步骤e:将所述标定权重特征送入CRNN之后的网络层,提取深度情感特征,通过Softmax分类器进行情感分类,生成最终分类结果。本发明所述方法相比于传统模型,在少量增加模型复杂度的前提下,平均识别率提升了8.43%,非同类情感区分效果明显,兼具良好的泛化性。
📄 2018115999079
📂 G10L15_02
👤 杭州电子科技大学
📅 2018-12-26
本发明公开了基于改进视觉Transformer模型的语音特征识别方法及系统,涉及语音特征识别技术领域,方法包括以下步骤:接收原始语音信号,对原始语音信号进行预处理得到语音处理信号;对语音处理信号提取声学特征,得到log‑Mel语谱图;将log‑Mel语谱图输入至预先建立的P2T模块内,得到特征向量;将特征向量输入至预先建立的SparseTransformer网络内,得到输出结果;将输出结果导入预先建立的Softmax分类器后,得到识别结果。
📄 2023108887578
📂 G10L15_02
👤 南京信息工程大学
📅 2023-07-19
本发明请求保护一种噪声环境下声纹识别的语音信号特征处理方法,包括步骤:(1)根据语音信号的特点对其进行信号的前期处理,包括语音信号的预加重,端点检测和加窗函数的选择;(2)估算发声个体的基音周期,并以此为依据对语音信号进行谱平滑处理,得到新的谱包络,计算通过梅尔滤波器的能量,最终通过离散余弦变换(DCT)计算得到梅尔平滑系数(SFCC)。(3)结合均值消减法、方差归一化、时间序列滤波法和加权自回归移动平均滤波法对SFCC进行后处理,得到回归平衡参数(MVDA);目的是通过平滑谱包络去除个体发声的不稳定因素和通过后处理算法去除环境噪声的影响,最终降低声纹识别的误识率。
📄 2016101250323
📂 G10L15_02
👤 重庆邮电大学
📅 2016-03-04
本发明公开了一种基于时频域统计特征提取的自然环境识别方法。本发明包括如下步骤:步骤1、采集各类自然环境的声音,如发动机、汽车喇叭、风噪声等,建立声音样本库;步骤2、声音样本信号的加窗分帧处理;步骤3、提取所有帧信号在时域上的统计特征;步骤4、标记特征向量所属声音来源的种类,建立样本特征库;步骤5、利用支持向量机训练特征向量,建立训练模型;步骤6,提取目标声音的特征向量;步骤7、利用支持向量机对目标声音的特征向量进行匹配分类;步骤8、提供识别结果。本发明弥补了传统的声音LPCC和MFCC特征提取方法在时频结合方面的不足,能够判断各类目标声音的所属类型。
📄 201610634966X
📂 G10L15_02
👤 杭州电子科技大学
📅 2016-08-04
本发明公开了基于堆叠基稀疏表示的音频事件分类方法及计算机设备,该方法在训练阶段首先创建各类音频事件的音频字典;然后,通过将各类音频事件的音频字典进行堆叠构建大型字典;测试阶段,根据训练阶段构建的大型字典提取测试音频样本的稀疏表示系数,并通过softmax函数对稀疏表示系数进行映射;最后,根据映射后的系数构建测试音频文档在各类音频事件上的置信度,并根据置信度的大小进行分类判别。本发明创新性地提出通过堆叠基构建大型字典,进而求得样本的稀疏表示系数;如此提取的稀疏表示系数能更好地表征音频事件样本,增大样本的类间差异,减少类内差异,提高分类准确率。
📄 2017106015659
📂 G10L15_02
👤 山东师范大学
📅 2017-07-21
本发明涉及一种基于神经网络堆叠自编码器多特征融合的声音识别方法。首先对原始声音数据进行分帧加窗,对分帧加窗后的数据分别提取其典型的时域线性预测倒谱系数与频域Mel频率倒谱系数特征;再对所提取的特征进行拼接,构建声信号的初步特征表示向量并创建训练特征库;然后采用多层神经网络堆叠自编码器进行特征融合与学习;该多层自编码器采用超限学习机算法学习训练;最后所提取的特征再采用超限学习机分类算法训练得到分类器模型;所构建的模型最后用于测试样本分类识别。本发明采用基于超限学习机多层神经网络堆叠自编码器的多特征融合,相比于传统单一特征提取方法,本发明具有更高的识别精度。
📄 2017108646951
📂 G10L15_02
👤 杭州电子科技大学
📅 2017-09-22
本发明公开了一种基于深度单分类器的电梯典型异常声音报警方法。本发明包括如下步骤:步骤1、分别对五种典型异常声音信号提取RMS特征;步骤2、分别对五种典型异常声音信号提取波谱质心Spectral Centroid特征;步骤3、分别对五种典型异常声音信号提取MFCC特征;步骤4、将输入训练样本进行特征提取;步骤5、计算分类学习的输出权重β;步骤6、计算单分类器阈值θ;步骤7、输入测试数据进行测试。本发明能够快速准确地对电梯内被困人员的反应进行检测识别,并与自动报警系统联动,便于快速报警并及时通知人员来处置。为电梯的安全高效运行,险情的及时处理,减少生命财产损失提供了保证。
📄 2019104812858
📂 G10L15_02
👤 杭州电子科技大学
📅 2019-06-04
本发明公开了一种基于图卷积神经网络的跨语料库情感识别方法,适用于语音情感识别领域使用。获取两个具有情感标签的音频数据库,两选取部分样本删除情感标签,对两个音频数据库的音频进行特征提取,得到多个情感特征组,建立图卷积神经网络模型,然后将GCN中每个节点与与之距离最近节点之间构成边,最终将节点和边连接构成一张新的图,音频定义为GCN的节点输入两层的图卷积神经网络,将有情感标签和无情感标签的音频放入图卷积神经网络进行训练,最终通过语音情感标签概率完成情感识别。其步骤简单,实现了跨多个数据库训练,有效提高训练后图卷积神经网络的准确率。
📄 2021104277210
📂 G10L15_02
👤 江苏师范大学
📅 2021-04-21
本发明公开了一种i‑vector向量提取方法、说话人识别方法、装置、设备及介质,其中,该i‑vector向量提取方法包括:获取说话人的训练语音数据,并提取训练语音数据对应的训练语音特征;基于预设UBM模型训练出与预设UBM模型对应的总体变化子空间;将训练语音特征投影在总体变化子空间上,获取第一i‑vector向量;将第一i‑vector向量投影在总体变化子空间上,获取与说话人对应的注册i‑vector向量。该方法使得训练语音特征数据经过两次投影也即降低维度后可去除更多的噪音特征,提高了提取说话人语音特征的纯净度,同时降维后减少计算空间也提高语音识别的识别效率。
📄 2018105740104
📂 G10L15_02
👤 平安科技(深圳)有限公司
📅 2018-06-06
本发明公开了一种语音识别方法,该方法包括:构建声学模型;当获取到原始语音信号时,对语音信号进行预处理以提取出有效的语音部分;从有效的语音部分提取声学特征;将声学特征输入至声学模型,通过已经训练完成的音素训练模型以对声学特征进行音素识别并输出识别结果至已经训练完成的基于记忆单元连接的混合神经网络模型;通过已经训练完成的基于记忆单元连接的混合神经网络模型根据接收到的识别结果输出与语音信息相对的文本信息。本发明还提供一种服务器及计算机可读存储介质。本发明提供的语音识别方法、服务器及计算机可读存储介质可以提高语音识别的准确率。
📄 2018102274748
📂 G10L15_02
👤 平安科技(深圳)有限公司
📅 2018-03-20
本发明提出了一种语音识别方法,该方法包括:获取待识别的语音数据;提取语音数据中的Filter Bank特征和MFCC特征;将MFCC特征作为GMM-HMM模型的输入数据,获取第一似然概率矩阵;将Filter Bank特征作为二维LSTM模型的输入特征,获取后验概率矩阵;将后验概率矩阵和第一似然概率矩阵作为HMM模型的输入数据,获取第二似然概率矩阵,根据第二似然概率矩阵在音素解码网络中获取对应的目标词序列。该方法通过将混合高斯模型和深度学习模型结合,且采用创新的二维LSTM模型作为声学模型,提高了语音识别的准确度。此外,还提出了一种语音识别装置、计算机设备及存储介质。
📄 2017104387727
📂 G10L15_02
👤 平安科技(深圳)有限公司
📅 2017-06-12
本发明涉及电子设备技术领域,公开一种语音识别方法及电子设备,包括:电子设备从用户预先输入的语音中提取声音因子,并且根据预设的语音发展规律模型,生成以声音因子为依据的用户的声音变化曲线;电子设备可以根据声音变化曲线识别出用户的当前语音。实施本发明实施例,能够根据预先获得的电子设备用户的语音,从而根据语音中的声音因子,结合语音发展规律模型生成用户的声音变化曲线,以使电子设备根据用户的声音变化曲线准确的识别该用户的当前声音,从而提高了电子设备语音识别的准确率。
📄 2018106027345
📂 G10L15_02
👤 广东小天才科技有限公司
📅 2018-06-12