本发明公开了一种基于卷积神经网络和联合优化的单通道语音分离方法,属于语音分离技术领域,包括对语音信号进行预处理,提取单个信号和混合语音信号的幅度谱特征,并计算多通道特征和目标信号的理想浮值掩蔽;将多通道特征输入卷积神经网络,并提取深度特征;将深度特征和多通道特征进行融合,作为全连接层的输入,输出为目标信号的理想浮值掩蔽,并进行参数寻优以训练卷积神经网络;将混合语音信号输入训练后的卷积神经网络,以实现对混合语音信号进行分离。本发明通过将混合幅度谱特征与深度特征在融合层进行融合来训练分离模型,使输入特征所包含的语音信息更加的丰富;对网络参数进行联合优化,使得分离语音的清晰度和可懂度大幅提高。
📄 2021109119798
📂 G10L21_0272
👤 南京邮电大学
📅 2021-08-10
本发明公开一种基于多层注意力机制的语音分离方法,包括以下步骤:S1:获取混合语音中特定讲话人的干净语音,并提取所述特定讲话人的声纹信息,所述混合语音包括多个讲话者;S2:通过多层注意结构和特定讲话人的声纹信息,连续净化所述混合语音,以获取分离语音。本发明在每一层中引入说话人信息以添加辅助信息以帮助提取语音,引入计算注意机制以处理每一层的输出,并通过多层结构提取语音信号。
📄 2019109136264
📂 G10L21_0224
👤 电子科技大学
📅 2019-09-25