本发明提供了一种语音音频筛选系统,包括:分析模块,用于对目标语音音频的语音特征进行分析,获得目标语音音频的语音特征;获取模块,用于获取第一语音音频,并分析第一语音音频的语音特征;对比模块,用于比对第一语音音频的语音特征与目标语音音频的语音特征,当二者的比对结果满足预设条件时确定第一语音音频为可选语音音频;本语音音频筛选系统能根据用户选择的目标语音音频筛选出符合要求的第一语音音频,便于用户筛选出符合某一部分听众喜好的第一语音音频。
📄 2019103396183
📂 G06F16_635
👤 广州智伴人工智能科技有限公司
📅 2019-04-25
已申报项目
本发明公开了一种基于麦克风阵列的语音增强方法及装置,该方法和装置更精准地估计出了混响和回声的声学路径,更好地抑制了回声和混响信号,使得输出的音频信号达到更高的信噪比,语音增强体验效果好,针对当前主流的硬件平台均能达到实时处理,且具备很强的鲁棒性。此外,本发明所提供的方法和装置在提升信号的信噪比的同时,能够大幅降低了信号处理的运算量。而在实现相同信噪比的要求下,传统的信号处理流程需要1‑3倍的运算量。
📄 2018106520417
📂 G10L21_0208
👤 重庆瑞可利科技有限公司
📅 2018-06-22
本发明涉及语音情绪识别领域,特别涉及一种基于空洞深度可分离群卷积轻量级网络的语音情绪识别方法,包括采用短期傅里叶变换对音频信号时频转换获得其输入特征图;采用逐点群卷积层对输入特征图降维和分解;采用深度空洞可分离卷积层将低维特征图转换成若干组与原始输入特征图同一维度的特征图;采用相似性判定模块判定该特征图是否符合情绪分类标准;采用分层特征融合技术将若干组特征图串联起来,生成输出特征图;采用下采样学习音频信号的时空特性,同时将输入特征图经过平均池化层实现维度匹配,将输出特征图与这二者进行串联叠加得到最终特征图;将最终特征表示进行情绪预测;本发明在不降低语音情绪识别精度的前提下大幅降低系统的复杂度。
📄 2022116809364
📂 G10L25_63
👤 重庆邮电大学
📅 2022-12-27
本公开的目的在于提供一种基于混合噪声生成模型的语音训练加噪系统及方法,包括:输入模块、噪声环境增强模块、语音噪声增强模块以及输出模块;其中,输入模块用于获取噪声环境简易描述信息和待增强的干净语音数据;噪声环境增强模块将噪声环境简易描述信息转化为带时序特征的结构化噪声事件序列;语音噪声增强模块根据所述噪声事件序列生成多源混合噪声,并将所述多源混合噪声按预设规则添加至所述干净语音数据,得到带噪语音数据;输出模块用于输出所述带噪语音数据,供语音模型训练使用。本公开充分衔接不同噪声源在时间维度上的叠加、抵消、干涉等交互特征,解决了传统混合方式仅能实现线性叠加的技术瓶颈。
📄 2026102136973
📂 G10L15_06
👤 广东工业大学
📅 2026-02-13
本发明公开了一种基于多特征融合的伪造语音检测方法及装置,包括:通过提取语音中的多种特征,通过特征缩放和特征平衡矩阵将提取的特征进行融合获得融合特征,融合特征尽可能的融合了语音中的特征,然后利用融合特征训练基于长短期记忆网络的伪造语音检测模型,实现对各种伪造语音方法生成的伪造语音的检测。
📄 2021107625916
📂 G10L25_51
👤 浙江工业大学
📅 2021-07-06
一种获取纯净语音的录音方法,包括以下步骤:1)用户将需要录音的文本输入语音合成引擎TTS,并选定一个音色参数;2)收到语音合成TTS引擎输出的合成音频,逐帧进行Fourier变换,生成频域系数;3)计算该帧频谱能量;4)基于能量系数对该帧进行清音浊音检测,如果是清音跳到步骤6),否则进行步骤5);5)对浊音帧频谱能量的部分共振峰系数使用用户事先录制的用户自身的浊音频谱共振峰系数代替,得到修正的该帧频谱能量系数;6)该帧频谱能量系数使用Griffin‑lem算法处理生成频域系数;7)对该帧频域系数进行反Fourier变换恢复成时域语音信号。本发明不需要依赖任何麦克风设备即能实现高纯净的语音录音。
📄 2019100177625
📂 G10L13_047
👤 浙江工业大学
📅 2019-01-09
一种神经网络的语音情感识别方法,包括:步骤1)语音特征MFCC的获取;步骤2)输入本发明中设计的基于神经网络的语音情感识别网络进行语音情感识别;步骤3)获得语音情感识别结果。本发明利用神经网络对语音信号进行情感识别,设计并实现了一个基于神经网络的语音情感识别网络,在进行语音情感识别时,仅需输入待识别的语音信号,即可得到识别的语音情感。对于输入的语音信号,语音情感识别网络能够自适应地提取出其中包含丰富情感信息的语音特征,利用情感特征来进行精确地语音情感识别。该发明对所有人都能进行准确地语音情感识别,具有较大地应用价值。
📄 2022102164528
📂 G10L25_63
👤 浙江工业大学
📅 2022-03-07
本发明提出了一种基于会议场景的噪声分类去除方法,包括以下步骤:步骤(1):首先根据会议场景下噪声的特点,将会议场景中的非背景噪声分为非目标说话人噪声、会议设备噪声、用户行为噪声、采集设备噪声;步骤(2):根据不同种类噪声与目标说话人语音之间在时域波形图和语谱图上的区别,利用双MIC降噪方法去除采集设备噪声,利用小波降噪方法去除用户行为噪声,利用SOX降噪方法去除会议设备噪声,利用PCA降噪方法去除非目标说话人噪声,从而去除会议场景下的噪声。本发明的优点是:能有效去除会议场景下的噪声,大大提高声纹识别系统的鲁棒性和准确率。
📄 2019101824622
📂 G10L17_02
👤 南京邮电大学
📅 2019-03-11
本发明公开了一种非平行文本条件下基于i向量的多对多说话人转换方法,包括训练阶段和转换阶段,使用了VAWGAN与i向量相结合来实现语音转换系统,能够较好地提升转换后语音的个性相似度和语音质量,实现了一种高质量的语音转换方法。此外,本方法解除对平行文本的依赖,实现了非平行文本条件下的语音转换,而且训练过程不需要任何对齐过程,本方法还可以将多个源‑目标说话人对的转换系统整合在一个转换模型中,即实现多说话人对多说话人转换。本方法在跨语种语音转换、电影配音、语音翻译等领域有较好的应用前景。
📄 2018113373380
📂 G10L13_08
👤 南京邮电大学
📅 2018-11-12
本发明公开了基于新阈值函数的小波语音去噪方法,该方法主要步骤包括:1)带噪语音产生;2)对带噪语音进行小波分解;3)对带噪语音进行小波阈值处理;4)对处理后的语音进行小波重构;5)得到去噪后语音信号;其中主要是对步骤3)进行处理,步骤3)直接决定去噪效果。步骤3)是对带噪语音进行小波分解后的小波系数进行阈值处理,主要涉及到阈值的确定以及阈值函数的选取。本发明采用的新阈值函数缓解了传统硬阈值函数不连续导致处理后信号产生振荡、软阈值函数处理信号后失真较大的问题。新的阈值函数能更好的抑制噪声,提高语音信号信噪比,减少语音失真,得到更好的去噪效果。
📄 2017104434291
📂 G10L21_0208
👤 南京邮电大学
📅 2017-06-13
本发明请求保护一种语音信号非连续传输及背景噪声生成方法,此方法包括:在语音帧向静音帧转换时加入过渡帧,根据静音帧中背景噪声的波动值大小来决定发送静音描述帧的频率。在解码端,以白噪声作为激励信号,通过线性预测编码合成滤波器后,再经过增益调整得到舒适噪声。本发明在传输噪声信号时具有较好的自适应性,并且合成的背景噪声在主观听觉上具有良好的连续性和舒适性。
📄 2013106828444
📂 G10L19_012
👤 重庆邮电大学
📅 2013-12-16
本发明提出一种基于谐波冲激分解的语音转换方法,包括如下步骤:S1,将语音信号分解成谐波信号和冲激信号;S2,将所述谐波信号进行语音转换,形成目标谐波信号;S3,将所述目标谐波信号与所述冲激信号进行叠加,形成目标语音信号。本发明采用谐波冲激分解模型对语音信号进行分解,将语音信号分解成谐波信号部分和冲激信号部分,仅对谐波信号部分做频谱分解和稀疏表示,不对冲激信号做任何处理,既能够保证信息的完全性、又可以减少信息的丢失,还有利于提高转换后语音的质量,处理过程简单、方便,推广性强,具有较高的应用前景。
📄 2018103356336
📂 G10L19_02
👤 杭州电子科技大学
📅 2018-04-16