本发明涉及一种基于深度残差网络和注意力机制的声纹识别方法、装置及计算机可读存储介质,属于语音识别技术领域,包括步骤:S1:对采集到的音频数据进行预处理,得到能够模拟人耳某些特性的MFCC特征;S2:构建FAM,将S1得到的特征经过帧级注意力模块对每帧的重要性进行加权运算,得到加权后的MFCC特征;S3:构建声纹识别网络并进行声纹识别;引入MobileNet的设计思想,将普通卷积替换为深度可分离卷积以降低网络参数量;在ResNet50的每一个layer后加入通道域注意力模块建模各个特征通道的重要程度,针对不同的说话人增强或抑制不同的通道,最后将特征输入网络中的分类器进行分类,实现声纹识别。
📄 2022103044434
📂 G10L17_02
👤 重庆邮电大学, 重庆市住房公积金管理中心
📅 2022-03-17
本发明提出了一种基于会议场景的噪声分类去除方法,包括以下步骤:步骤(1):首先根据会议场景下噪声的特点,将会议场景中的非背景噪声分为非目标说话人噪声、会议设备噪声、用户行为噪声、采集设备噪声;步骤(2):根据不同种类噪声与目标说话人语音之间在时域波形图和语谱图上的区别,利用双MIC降噪方法去除采集设备噪声,利用小波降噪方法去除用户行为噪声,利用SOX降噪方法去除会议设备噪声,利用PCA降噪方法去除非目标说话人噪声,从而去除会议场景下的噪声。本发明的优点是:能有效去除会议场景下的噪声,大大提高声纹识别系统的鲁棒性和准确率。
📄 2019101824622
📂 G10L17_02
👤 南京邮电大学
📅 2019-03-11
本发明公开了一种基于Fbank特征和MFCC特征融合的声纹识别方法,本发明先对于语音数据集进行预处理,提取Fbank特征和MFCC特征;将得到40维Fbank特征和12维MFCC特征的基础上进行特征融合。本发明在广义端到端模型上进行实验,相比单独的Fbank和MFCC特征,本发明提出的特征融合方法优于单独的特征。本发明的特征融合方法降低了特征维度、降低了冗余、减少了存储空间以及训练复杂度。
📄 2021105861346
📂 G10L17_02
👤 杭州电子科技大学
📅 2021-05-27
本发明公开一种基于多层次特征融合的短语音说话人识别方法,涉及说话人识别技术领域,其方法包括:通过对包含目标短语音说话人的语音数据进行特征提取预处理,分别提取所述语音数据中的声学特征、韵律特征以及深层特征;通过对所述声学特征、所述韵律特征以及所述深层特征分别进行优化处理,得到优化后的声学特征、优化后的韵律特征以及优化后的深层特征;通过对所述优化后的声学特征、所述优化后的韵律特征以及所述优化后的深层特征进行融合处理,得到融合处理后的多通道特征;将所述融合处理后的多通道特征输入至训练好的深度神经网络模型中得到特征相似度值,并根据所述特征相似度值确定所述语音数据对应的目标短语音说话人。
📄 2023109868076
📂 G10L17_02
👤 成都信息工程大学
📅 2023-08-08
本申请涉及一种身份验证方法、系统、计算机设备和存储介质。所述方法包括:获取待验证语音信息和相应的用户标识;从该待验证语音信息中提取待验证的声纹特征和待验证文本;获取当前场景类型;查询与该当前场景类型匹配、且与该用户标识对应的特征模型;通过该特征模型,将该待验证文本转换为参考声纹特征;比较该待验证的声纹特征和该参考声纹特征,得到语音验证结果;当该语音验证结果表示验证通过时,则根据该待验证的声纹特征对该特征模型进行再训练;使用再训练后的特征模型更新与该当前场景类型匹配、且与该用户标识对应的特征模型。采用本方法能够在用户声音发生变化时,也能够识别出用户本人的声音,进而提高语音验证的召回率。
📄 2018100417643
📂 G10L17_02
👤 平安科技(深圳)有限公司
📅 2018-01-16
本发明公开了一种说话人认证方法,该方法包括:获取预设说话人的语音信息,其中,语音信息不限制内容;构建3D卷积神经网络架构;将说话人的语音信息输入至3D卷积神经网络架构;通过3D卷积神经网络架构创建并存储说话人的语音模型;当接收到测试话语时,将测试话语信息与存储的说话人的语音模型进行对比;计算测试话语信息与说话人的语音模型的相似度,当相似度大于一预设值时,则说话人认证成功,当相似度小于一预设值时,则说话人认证失败。本发明还提供一种服务器及计算机可读存储介质。本发明提供的说话人认证方法、服务器及计算机可读存储介质通过创建说话人的与文本无关的语音模型作为密码,不易破解,提高服务器使用安全。
📄 2018102464973
📂 G10L17_02
👤 平安科技(深圳)有限公司
📅 2018-03-23
本发明公开了一种基于多尺度通道分离卷积特征提取的说话人聚类方法,属于声纹识别技术领域,包括以下步骤:将VoxCeleb和AMI数据集切分为训练集、开发集和测试集;对VoxCeleb和AMI数据进行预处理;在ECAPA‑TDNN网络框架的基础上搭建多尺度通道分离卷积模块;选用AAM‑softmax损失函数对模型进行多次训练得到最优模型;利用多尺度通道分离卷积模型对AMI会议数据提取特征,并运用谱聚类进行聚类分析;使用标准的分割聚类错误率DER对聚类结果打分。本发明能够提取到具有判别性的声纹特征,并在谱聚类算法上取得良好的效果,以相对较小的参数量为代价取得了更低的分割聚类错误率。
📄 2022105883890
📂 G10L17_02
👤 滨沅国科(秦皇岛)智能科技股份有限公司
📅 2022-05-26
本发明涉及语音识别技术领域,具体公开了一种语音增强方法、语音识别方法、说话人识别方法和系统,包括基于纯净语音、纯净噪声和散射噪声生成双麦远场带噪语音;基于纯净语音生成多个目标语音,并记录多个目标语音方位;将空间方位均匀地划分为若干个目标区域;基于若干个目标区域对多个目标语音方位进行标签化,获得标签化目标语音方位;从标签化目标语音方位提取双麦远场带噪语音的特征,以获得每个目标区域的特征;构建掩蔽神经语音增强模型;基于每个目标区域的特征、目标语音以及标签化目标语音方位训练掩蔽神经语音增强模型,基于训练好的掩蔽神经语音增强模型增强语音信号;该方法对目标语音方向进行选择性关注,实现语音增强。
📄 2023102380803
📂 G10L17_02
👤 深圳市玮欧科技有限公司
📅 2023-03-14
本发明提供语音信号处理方法、装置及设备,其中,方法包括:获取待处理语音信号对应的第一统计特征向量,所述第一统计特征向量用于表示所述待处理语音信号在M维特征空间中每维特征空间的统计值,所述M为大于1的整数;将所述第一统计特征向量输入第一模型进行处理,获得第二统计特征向量,所述第一模型用于根据所述M维特征空间中每维特征空间的重要程度对所述第一统计特征向量进行处理;根据所述第二统计特征向量,确定所述待处理语音信号的目标类别,所述目标类别包括原始语音信号或者录音重放语音信号。该技术方案可以提高录音重放信号检测的准确性。
📄 2020100961004
📂 G10L17_02
👤 平安科技(深圳)有限公司
📅 2020-02-17
本申请公开一种音频信号处理的方法及装置,其中,所述音频信号处理方法包括:获取待处理的第一音频信号;确定所述第一音频信号包含的至少一个音素;计算所述至少一个音素的音素覆盖率,若所述音素覆盖率满足目标条件,则将第一声纹识别模型更新为第二声纹识别模型。采用本申请的技术方案,能够保证最终得到的声纹识别模型是通过能较为完整地反映用户发音特征的音频信号训练得到的,提高声纹识别模型进行说话人辨识的准确度。
📄 201911038804X
📂 G10L17_02
👤 平安科技(深圳)有限公司
📅 2019-10-29
本发明适用于计算机技术领域,提供了一种语音验证方法、装置、计算机设备及存储介质,该语音验证方法包括以下步骤:获取待验证的语音信息;基于预设的有效信息提取方法,提取所述待验证的语音信息中的有效语音信息;基于预设的线性预测函数,提取所述有效语音信息的声纹发声器官特征向量,并确定为待验证的声纹发声器官特征模型;获取至少一个预设的声纹发声器官特征对比模型,并确定与所述待验证的声纹发声器官特征模型的对数似然函数值最大的声纹发声器官特征对比模型;根据所述对数似然函数值最大的声纹发声器官特征对比模型确定语音验证结果。该语音验证方法,可以提高语音验证的准确性,以及可以适用于文本无关的声纹识别。
📄 2019111053382
📂 G10L17_02
👤 效生软件科技(上海)有限公司
📅 2019-11-11
已申报项目
本发明公开一种基于原生声纹特征的拾音翻译方法、设备及存储介质,涉及语音识别技术领域。本发明包括,获取原生音频;将原生音频进行分割得到多个原音素以及对应的顺序;获取每个原音素的若干个种类的声纹特征;对原生音频进行语义识别得到原语种文本;将原语种文本翻译为转译语义文本;对转译语义文本进行音素拟合得到多个转译音素以及对应的顺序;根据原音素和对应的顺序以及对应的若干个种类的声纹特征对转译音素进行修正得到转译音频。本发明通过对发言者的原生声纹特征进行识别提取,实现对语音翻译结果的修正,同时实现对翻译结果的润色。
📄 2023117734938
📂 G10L17_02
👤 苏州金钥匙自动化设备有限公司
📅 2023-12-21