本发明公开了一种面向家居口语环境的神经网络语音识别方法及系统,该方法包括:模型构建:在深度神经网络中加入长短期记忆网络,构建组合神经网络DNN-LSTM模型;对采集的语音数据集预处理,得到特征向量集,并将特征向量集作为所述DNN-LSTM模型的输入进行迭代训练,训练至最优声学模型;将一个未知语种的输入语音信号,经过训练后的DNN-LSTM模型,分别得到中文输出概率向量集和英文输出概率向量集;根据所述中文输出概率向量集和英文输出概率向量集进行语种匹配,并输出判断结果;本发明能够快速准确的识别家居场景下说话人的内容,可以广泛应用于实际家居场景。
📄 2020102950682
📂 G10L15_16
👤 南京邮电大学
📅 2020-04-15
本发明公开了一种基于改进稠密神经网络的水声信号调制方式类间识别方法,首先接收待识别的水声调制信号,提取水声调制信号特征;运用主分量分析法对水声调制信号特征进行降维去噪;再进行归一化与维度变更;基于稠密神经网络,去掉池化层,得到改进的稠密神经网络,并对该神经网络进行训练;将处理后的水声调制信号特征输入到训练好的改进的稠密神经网络中,最终完成调制方式类间识别。本发明最终实现低延迟、高准确率的水声信号调制方式类间识别,识别方法抗干扰能力强、计算成本低、识别准确率高。
📄 2021102141678
📂 G10L15_16
👤 青岛科技大学
📅 2021-02-26
本发明公开的一种基于生成式听觉模型的端到端汉语方言识别系统和方法,涉及语音识别技术领域。该汉语方言识别系统,用CNN模拟听觉模型对方言时域声音波形进行特征提取,随后将提取出的固定长度特征序列输入至RNN中,再连接全连接层后进行softmax,用于预测方言类别。本发明公开的一种基于生成式听觉模型的端到端汉语方言识别系统和方法,可有效提高NN方言识别过程中的抗噪性能,并因其提取了原始声音的深层次语言特征以及其模型具有一定的关注模型信息,所以在一定程度上也提高了方言识别率。
📄 2018112283071
📂 G10L15_16
👤 江苏师范大学
📅 2018-10-22
本申请公开了一种基于自注意力机制和记忆网络的语音识别方法及装置,涉及人工智能技术领域,可以解决目前在进行语音识别时,现有模型在计算复杂度和准确率上都有一定的局限性,导致语音识别效果较差且效率较低的问题。其中方法包括:依据自注意力机制和记忆网络LSTM更新RNN‑Transducer模型的编码器结构和解码器结构;提取目标语音的语音序列特征以及文本序列特征;利用更新后的RNN‑Transducer模型基于所述语音序列特征和所述文本序列特征,确定所述目标语音对应的目标文本标签。本申请适用于对语音的在线识别,例如可应用于对话机器人、在线教育、实时会议系统等场景。
📄 202011434955X
📂 G10L15_16
👤 平安科技(深圳)有限公司
📅 2020-12-10
本发明公开了基于偏移和卷积自适应的非母语中文语音识别方法与系统,涉及语音识别技术领域,方法包括以下步骤:选择预训练模型,添加TBA模块和卷积自适应模块构成非母语中文语音识别模型;利用训练好的非母语中文语音识别模型实现非母语中文语音识别;TBA模块根据语音帧生成重要性权重和偏置项,并输出偏置向量到前馈层;卷积自适应模块将表示向量转换为特征加权向量。本发明结合TBA和卷积自适应模块,提高了模型对语音token重要性的理解以及有效提取编码知识,这种技术组合不仅增强了模型的识别准确性,还提升了其在多语言环境或全球化应用中的适应性,在非母语中文语音识别任务中展现出显著的有益效果。
📄 2024117836353
📂 G10L15_16
👤 华侨大学
📅 2024-12-06
本发明请求保护一种基于深度双向长短时记忆(DBLSTM)递归神经网络(RNN)的声学模型,DBLSTM网络主要分为三部分:在DBLSTM的全连接部分,使用Maxout神经元代替原来的Sigmoid神经元来解决RNN中常出现的梯度消失和爆炸的问题;同时使用Dropout正则化训练算法避免了神经网络在训练过程中出现过拟合。在多层BLSTM部分,为适应DBLSTM对每个时间步长的双向依赖性,提出了上下文敏感块的随时间反向传播(CSC-BPTT)算法来训练该网络。在多层BLSTM部分之后采用一层选择链接层,用于对DBLSTM的输出进行变换得到全连接部分的输入。本发明可得到更高的语音识别率。
📄 2017107024405
📂 G10L15_16
👤 重庆邮电大学
📅 2017-08-16
本发明请求保护一种基于改进型CLDNN结构的端到端语音识别方法,常用于语音识别的传统CLDNN结构采用全连接LSTM(Long Short Term Memory)模型处理语音信号中的时序信息,在训练过程中易发生过拟合现象,影响学习效果。更深的模型往往表现更为优秀,但通过简单堆叠网络层增加模型深度会发生梯度消失、梯度爆炸和“退化”问题。针对以上现象及问题,本发明提出一种改进型CLDNN结构,采用残差网络和ConvLSTM结合方式建立残差ConvLSTM模型,并以此代替传统CLDNN结构中的全连接LSTM模型。该模型结构改善了传统CLDNN模型存在的问题,并且可以通过堆叠残差ConvLSTM块增加模型深度而不发生梯度消失、梯度爆炸和“退化”问题,使语音识别系统性能更优。
📄 2019101154866
📂 G10L15_16
👤 重庆邮电大学
📅 2019-02-14
本发明涉及一种基于自适应掩膜和分组线性变换的轻量级语音识别方法,属于数据处理领域。该方法包括以下步骤:S1:基于自适应掩膜注意力机制的编码;S2:基于分组线性变换。本发明从模型算法角度出发,为解决语音识别在边缘计算设备上的轻量化部署难题提供一种新的方法,通过基于自适应掩膜的局部注意力机制提取语音特征的局部信息并与融合全局信息,使用基于分组线性变换的解码网络,完成对语音高层抽象特征的轻量化解码。
📄 2021103677790
📂 G10L15_16
👤 重庆邮电大学
📅 2021-04-06