本发明公开了一种基于卷积神经网络和联合优化的单通道语音分离方法,属于语音分离技术领域,包括对语音信号进行预处理,提取单个信号和混合语音信号的幅度谱特征,并计算多通道特征和目标信号的理想浮值掩蔽;将多通道特征输入卷积神经网络,并提取深度特征;将深度特征和多通道特征进行融合,作为全连接层的输入,输出为目标信号的理想浮值掩蔽,并进行参数寻优以训练卷积神经网络;将混合语音信号输入训练后的卷积神经网络,以实现对混合语音信号进行分离。本发明通过将混合幅度谱特征与深度特征在融合层进行融合来训练分离模型,使输入特征所包含的语音信息更加的丰富;对网络参数进行联合优化,使得分离语音的清晰度和可懂度大幅提高。
📄 2021109119798
📂 G10L21_0272
👤 南京邮电大学
📅 2021-08-10
本发明提供了一种基于多尺度时延采样的单通道语音分离方法,提取多个说话人混合语音信号混合语音特征,对混合语音特征进行分割,并拼接成3D张量,采用第一双向循环神经网络迭代地对3D张量进行建模,捕获局部特征信息和全局特征信息,采用多尺度时延采样建模,对第一双向循环神经网络的输出进行不同尺度的时延采样,并采用第二双向循环神经网络捕获不同尺度下的特征信息,将特征信息进行重叠相加,并映射为多个说话人纯净语音的掩码,再将掩码与混合语音特征进行点乘,得到多个说话人的纯净语音表征,将每个人的纯净语音表征重构成分离后的语音信号。本发明通过多尺度时延采样建模,弥补分段式建模中的信息缺失,极大地提升了语音分离性能。
📄 2021110062517
📂 G10L21_0208
👤 江苏大学
📅 2021-08-30
本发明公开一种基于多层注意力机制的语音分离方法,包括以下步骤:S1:获取混合语音中特定讲话人的干净语音,并提取所述特定讲话人的声纹信息,所述混合语音包括多个讲话者;S2:通过多层注意结构和特定讲话人的声纹信息,连续净化所述混合语音,以获取分离语音。本发明在每一层中引入说话人信息以添加辅助信息以帮助提取语音,引入计算注意机制以处理每一层的输出,并通过多层结构提取语音信号。
📄 2019109136264
📂 G10L21_0224
👤 电子科技大学
📅 2019-09-25
本发明涉及语音处理技术领域,尤其涉及一种卷积增强外部注意力的多说话人时域语音分离方法。方法包括:S1.通过编码器将多说话人混合语音,进行卷积运算,转换为其潜在特征表示;通过基于卷积增强外部注意力模块的分离器学习得到语音掩码;语音掩码与编码器输出的潜在特征表示相乘,再通过解码器的反卷积运算重建波形得到分离后的语音。本发明能够满足语音分离较小模型、高时效性的需求,并且以其序列建模的优势来达到更好的分离效果;增强了外部注意力机制学习到更多的特征和相关性,且保持了其分离速度快的优势;在双路结构中的应用可以较好地平衡时效性、模型大小和分离效果。
📄 2022106470594
📂 G10L21_0272
👤 重庆理工大学
📅 2022-06-09