本发明公开一种基于声音诱发脑电信号的说话人识别方法。本发明通过采集脑电数据,提取听觉刺激部分时频特征和时域统计特征的融合特征。采用alpha频段基线校正部分的脑电信号获得的融合特征作为背景模板。将听觉刺激部分融合特征减去背景模板得到干净任务态数据融合特征,最后利用本发明提出的网络模型区分不同说话人。本发明提供了一种可行的基于声音诱发脑电信号的说话人识别方法,并利用训练好的分类器去区分不同说话人,准确率达到90%。
📄 2021102414247
📂 G10L17_00
👤 北京神康云科技有限公司
📅 2021-03-04
本发明公开一种基于多层次特征融合的短语音说话人识别方法,涉及说话人识别技术领域,其方法包括:通过对包含目标短语音说话人的语音数据进行特征提取预处理,分别提取所述语音数据中的声学特征、韵律特征以及深层特征;通过对所述声学特征、所述韵律特征以及所述深层特征分别进行优化处理,得到优化后的声学特征、优化后的韵律特征以及优化后的深层特征;通过对所述优化后的声学特征、所述优化后的韵律特征以及所述优化后的深层特征进行融合处理,得到融合处理后的多通道特征;将所述融合处理后的多通道特征输入至训练好的深度神经网络模型中得到特征相似度值,并根据所述特征相似度值确定所述语音数据对应的目标短语音说话人。
📄 2023109868076
📂 G10L17_02
👤 成都信息工程大学
📅 2023-08-08
本发明公开了一种i‑vector向量提取方法、说话人识别方法、装置、设备及介质,其中,该i‑vector向量提取方法包括:获取说话人的训练语音数据,并提取训练语音数据对应的训练语音特征;基于预设UBM模型训练出与预设UBM模型对应的总体变化子空间;将训练语音特征投影在总体变化子空间上,获取第一i‑vector向量;将第一i‑vector向量投影在总体变化子空间上,获取与说话人对应的注册i‑vector向量。该方法使得训练语音特征数据经过两次投影也即降低维度后可去除更多的噪音特征,提高了提取说话人语音特征的纯净度,同时降维后减少计算空间也提高语音识别的识别效率。
📄 2018105740104
📂 G10L15_02
👤 平安科技(深圳)有限公司
📅 2018-06-06
本发明公开了一种说话人认证方法,该方法包括:获取预设说话人的语音信息,其中,语音信息不限制内容;构建3D卷积神经网络架构;将说话人的语音信息输入至3D卷积神经网络架构;通过3D卷积神经网络架构创建并存储说话人的语音模型;当接收到测试话语时,将测试话语信息与存储的说话人的语音模型进行对比;计算测试话语信息与说话人的语音模型的相似度,当相似度大于一预设值时,则说话人认证成功,当相似度小于一预设值时,则说话人认证失败。本发明还提供一种服务器及计算机可读存储介质。本发明提供的说话人认证方法、服务器及计算机可读存储介质通过创建说话人的与文本无关的语音模型作为密码,不易破解,提高服务器使用安全。
📄 2018102464973
📂 G10L17_02
👤 平安科技(深圳)有限公司
📅 2018-03-23
本发明提供了一种多重注意力特征融合的说话人识别方法,构建深度说话人表征模型,包括特征提取器和说话人分类器,Fbank特征作为深度说话人表征模型的输入,通过特征提取器将Fbank特征提取为说话人表征,在训练阶段,使用说话人分类器将说话人表征映射到说话人标签上,并构造损失函数对深度说话人表征模型进行优化;在测试阶段,采用余弦距离比较说话人表征之间的相似度,根据阈值判断是否为相同的说话人。本发明通过多重注意力特征融合对不同分支的特征进行加权融合,多重注意力特征融合包括空间注意力机制和通道注意力机制,增强了每个分支中的有效信息,获得更加鲁棒性的说话人识别性能。
📄 2021109863976
📂 G10L17_04
👤 江苏大学
📅 2021-08-26
本发明公开了一种基于自动编码深度置信网络的高质量说话人识别方法,包括模型训练和说话人识别:首先对说话人语音进行预处理,提取MFCC特征参数,为不同说话人特征参数进行标记。将多名说话人特征参数输入深度置信网络进行网络训练学习,得到自动编码深度置信网络。利用训练好的自动编码深度置信网络分别对每个说话人提取的特征参数进行编码重构,输出数据作为矢量量化模型的输入,进行矢量量化模型训练。说话人识别阶段,说话人的语音特征参数经自动编码深度置信网络编码重构,输入矢量量化模型进行识别。通过深度置信网络对说话人语音特征的编码重构,提取说话人个性特征的同时,可以过滤语音中的噪声,提高了说话人识别准确性和系统鲁棒性。
📄 2017100883003
📂 G10L15_06
👤 南京邮电大学
📅 2017-02-17
本发明请求保护一种基于通道‑空间注意力的动态卷积说话人识别方法,该方法包括步骤:S1,将声音信号切为多个片段,提取声音信号的声学特征;S2,为解决静态卷积以及一般动态卷积方法中注意力权重矩阵信息量不足的问题,使用通道注意力以及空间注意力融合的双注意力方法提取注意力权重矩阵;S3,将通道注意力与空间注意力权重矩阵融合作为动态卷积的注意力权重矩阵并与多个静态卷积核按权重相加,得到最终的动态卷积核。S4,将输入语音数据与该动态卷积核卷积得到说话人语音帧级特征。
📄 2022108361464
📂 G10L17_18
👤 重庆邮电大学
📅 2022-07-15