本发明提出了一种基于双向注意力残差网络的语音欺诈检测方法,能够有效提升欺诈语音检测系统的识别性能,防止欺诈语音通过自动说话人验证系统(ASV)。在训练过程中,本发明首先对语音进行预处理,并提取常数Q变换(CQT)特征矩阵,将其作为残差网络(ResNet)的输入,利用ResNet提取浅层特征,然后将此特征输入双向注意力网络,以区分特征中不同维度的重要程度,从而得到区分性更强的特征表示。在测试阶段,利用训练好的网络模型作为真实语音与欺诈语音的分类器,对语音进行打分,根据打分结果对真实语音与欺诈语音进行分类。实验结果表明,本发明方法能够明显提升欺诈检测系统的性能,保护ASV系统免受不法用户的侵害。本发明可应用在语音处理和生物识别领域。
📄 2022111864721
📂 G10L17_18
👤 哈尔滨理工大学
📅 2022-09-27
本发明请求保护一种基于通道‑空间注意力的动态卷积说话人识别方法,该方法包括步骤:S1,将声音信号切为多个片段,提取声音信号的声学特征;S2,为解决静态卷积以及一般动态卷积方法中注意力权重矩阵信息量不足的问题,使用通道注意力以及空间注意力融合的双注意力方法提取注意力权重矩阵;S3,将通道注意力与空间注意力权重矩阵融合作为动态卷积的注意力权重矩阵并与多个静态卷积核按权重相加,得到最终的动态卷积核。S4,将输入语音数据与该动态卷积核卷积得到说话人语音帧级特征。
📄 2022108361464
📂 G10L17_18
👤 重庆邮电大学
📅 2022-07-15