面向语音识别系统的音乐嵌入攻击防御方法,包括:(1)数据集准备及预处理;(2)训练语音识别模型;(3)预训练生成对抗网络;(4)重训练生成对抗网络;(5)生成对抗样本;(6)对抗训练。本发明通过生成对抗网络生成音乐音频,并且使用语音识别模型得到对抗音频的转录结果,利用转录结果与目标短语之间的损失以及判别器的判别结果设置目标函数来优化生成器,使得生成的对抗音频能够不被人耳所识别且转录为目标短语;通过对抗训练提高语音识别系统防御对抗样本攻击的能力。
📄 2020100621977
📂 G10L15_06
👤 浙江工业大学
📅 2020-01-20
一种基于特征聚类分析与特征降维的声纹识别后门攻击防御方法,首先用一个未知的数据集自然的训练一个声纹识别模型;再利用这个预训练的模型将所有训练数据分为不同的类别并按照类别的划分提取样本在模型特征层的输出;基于中毒样本与正常样本在模型分类时的行为差异,利用聚类算法对这些特征进行聚类;然后利用聚类指标CH分数识别出中毒类别;再使用降维算法把样本的特征降至一维,根据降维后数据的值识别中毒簇并删除;最后用余下的干净样本重新训练一个干净的模型。本发明的防御方法能准确的识别中毒类别并精准删除中毒样本,极大的降低了后门攻击的成功率。
📄 202211040227X
📂 G10L15_06
👤 浙江工业大学
📅 2022-08-29
本发明公开了一种基于CycleGAN的语音识别模型的防御方法及装置,所述防御方法利用对抗样本数据集和正常语音数据集训练CycleGAN模型,使该模型中的GA~B生成器能够对对抗样本进行去噪操作,而对于正常样本没有影响,将其集成到语音识别模型中作为前端处理装置,提高语音识别模型的识别精度,并使语音识别模型能够抵御对抗样本的攻击,提高语音识别模型的鲁棒性。
📄 2020104330398
📂 G10L15_06
👤 浙江工业大学
📅 2020-05-20
本发明公开了一种针对语音识别系统黑盒攻击模型的防御方法以及防御装置。该防御方法利用对原始音频添加模拟环境噪声,模拟现实场景下的语音输入情况,随机添加噪声后形成初代对抗样本,通过遗传算法和梯度估计对对抗样本进行优化,获得精确对抗样本,然后将原始音频文件和对抗样本混合,作为对抗训练的训练数据集,对模型进行在训练,提高了模型对对抗样本的识别准确率,从而提高了模型对于对抗攻击的鲁棒性。
📄 2019110310435
📂 G10L15_06
👤 浙江工业大学
📅 2019-10-28
一种基于PSO算法的语音识别攻击防御方法,包括:(1)准备原始音频数据集,分成预训练数据集、测试数据集和用于生成对抗样本的扰动数据集;(2)训练语音识别模型:搭建语音识别模型并初始化模型的相关参数,利用预训练数据集对语音识别模型进行训练,并使用测试数据集测试模型的识别准确率;(3)攻击语音识别模型:搭建基于PSO算法的攻击方法,设置适应度函数及PSO算法的相关参数,利用该攻击方法生成的最优对抗样本能够被错误识别且不被人耳识别;(4)对抗训练语音识别模型:将步骤(3)中生成的对抗样本加入预训练数据集中,重新训练语音识别模型,使得语音识别模型具有防御对抗样本攻击的能力,提高模型的安全性和稳定性。
📄 2019108516980
📂 G10L15_06
👤 浙江工业大学
📅 2019-09-10
本发明公开了一种非平行文本条件下基于文本编码器的多对多语音转换方法,包括了训练部分和转换部分,使用了条件变分自编码器和生成对抗网络(VAWGAN)与文本编码器(Text-Encoder)相结合来实现语音转换系统,在VAWGAN中加入代表语义的句子嵌入,能够较好地提升转换后语音的语音质量和个性相似度,实现高质量的语音转换。此外,本方法解除了对平行文本的依赖,实现了非平行文本条件下的语音转换,而且训练过程不需要任何对齐过程,提高了语音转换系统的通用性和实用性。此外,本方法可以将多个源-目标说话人对的转换系统整合在一个转换模型中,即实现多说话人对多说话人转换。本方法在电影配音、语音翻译、语音合成等领域有较好的应用前景。
📄 2018114063555
📂 G10L15_06
👤 南京邮电大学
📅 2018-11-23
本发明公开了基于音频事件和主题模型的音频场景识别方法及其装置,该方法包括训练音频场景分类模型;提取待识别音频文档的主题分布作为音频特征,并将提取的音频特征代入音频场景分类模型中进行分类识别,最终输出待识别音频文档的音频场景类别。本发明提出以音频事件作为统计单元,创新性地对音频文档‑音频事件共现矩阵进行主题分析,其与人类的音频场景识别模式更加一致,因此本发明提出的音频场景识别思路更加合理,更能提高识别的准确率。
📄 2016105250553
📂 G10L15_06
👤 山东师范大学
📅 2016-07-05
本发明涉及一种智能学习轮椅及其语音学习方法。本发明的一种智能学习轮椅,包括轮椅本体,包括座椅、设置在座椅两侧的扶手、设置在座椅下方前部通过支撑架连接的万向轮组以及转动万向轮组方向的转向机构、设置在座椅下方后部通过支撑架连接的主动轮组以及驱动主动轮组的驱动机构;避障系统,设在座椅下方;语音学习系统包括语音接收系统、语音识别模块、A/D转换器和存储器;所述收集装置设有语音学习按钮;所述语音学习按钮能够将收集装置收集到的语音指令传送到语音接收器并能够进行语音学习;控制系统,包括设置有中央处理器的单片机。本发明可以用语音指令控制自己的轮椅行驶,并能够进行语音学习准确识别;能够自动行驶、自动避障。
📄 2019101174268
📂 G10L15_06
👤 临沂大学
📅 2019-02-15
本申请公开了一种语音识别的方法,属于语音识别领域。所述方法包括:接收终端发送的语音识别请求,其中,所述语音识别请求中携带有待识别语音数据和对应的第一领域标识;基于所述第一领域标识,以及预先存储的领域标识和领域语音识别模型的对应关系,确定用于识别所述待识别语音数据的领域语音识别模型;基于所述用于识别所述待识别语音数据的领域语音识别模型,确定所述待识别语音数据对应的结果文本数据;向所述终端发送所述结果文本数据。通过本申请可以提供语音识别的准确性。
📄 2019112756703
📂 G10L15_06
👤 杭州海康威视数字技术股份有限公司
📅 2019-12-12
复杂环境下基于语音增强的深度神经网络语音识别方法,以深度学习神经网络以及语音增强为技术背景搭建模型。首先搭建复杂语音环境数据集,在语音识别前端语音信号预处理阶段对各类待识别复杂语音条件下的语音信号进行语音增强;然后建立语言文本数据集,搭建语言模型,用算法对语言模型进行训练;并建立中文汉语词典文件;然后搭建神经网络声学模型,并用增强后语音训练集,借助语言模型和词典对声学模型进行训练,得到声学模型权重文件,从而实现复杂环境下中文语音的精准识别。很好地解决了现有语音识别算法对噪音因素敏感、对语音质量要求高、应用场景单一的问题。
📄 2020108807777
📂 G10L15_06
👤 西安电子科技大学,陕西理工大学
📅 2020-08-28
本发明公开了一种说话人聚类方法、装置、计算机设备及存储介质,其中,该说话人聚类方法包括:将至少两个待聚类语音按语音时长降序排列;依序将每一待聚类语音与预设声学模型库中每一原始通用语音向量进行语音识别,获取与待聚类语音对应的目标通用语音向量;若待聚类语音在目标通用语音向量中的语音特征相似度不大于预设阈值,则采用待聚类语音进行模型训练,与待聚类语音对应的当前通用语音向量;将当前通用语音向量存储在预设声学模型库中,并将待聚类语音归类到对应的聚类类簇中。本发明通过判定待聚类语音的语音特征相似度不大于预设阈值时,自动生成与待聚类语音对应的当前通用语音向量,提高分类的准确性。
📄 2018105928679
📂 G10L15_06
👤 平安科技(深圳)有限公司
📅 2018-06-11
本申请提供一种模型训练方法、语音识别方法、装置、设备及存储介质,该方法包括:根据多个第一训练样本,对第一预设语音识别模型进行迭代训练,得到第一语音识别模型;将第一语音识别模型与预设语言模型进行融合,得到第二语音识别模型;将多个第二训练样本中的第二语音序列输入至第二语音识别模型,得到每个第二语音序列对应的第二文本和融合分数;根据每个第二语音序列的融合分数,从多个第二语音序列中筛选出目标语音序列;根据每个目标语音序列、每个目标语音序列对应的第二文本和多个第一训练样本,对第二预设语音识别模型进行迭代训练,得到目标语音识别模型。本申请涉及人工智能,能够提高语音识别模型的训练效率。
📄 2020114534461
📂 G10L15_06
👤 平安科技(深圳)有限公司
📅 2020-12-11