本发明公开了一种面向DAS系统的高质量音频生成方法,对低质量、高质量音频数据进行预处理及特征提取,分别得到集合多个短时间帧的音高特征‑梅尔频谱特征数据对的数据集D1和D2;构建包括多通道输入的生成网络和判别网络的高质量音频生成模型;用D2训练生成网络以学习高质量音频的先验分布;判别网络对生成网络的生成信号进行判断,若损失函数小于设定阈值,则结束训练,反之则优化生成网络与判别网络,重复训练;再用D1和D2训练高质量音频生成模型;对待处理的低质量音频进行预处理和特征提取后,输入训练好的高质量音频生成模型,得到高质量音频。本发明提高了音频信号的空间分辨率和一致性,能够更精确地进行高质量音频的生成。
📄 2024116262991
📂 G10L13_027
👤 浙江工业大学
📅 2024-11-14
本发明公开了一种基于改进Tacotron2模型的中文音节语音合成方法与系统,涉及语音合成技术领域,方法包括如下步骤:构建并训练中文音节语音合成模型;将待合成的音素音频输入训练好的中文音节语音合成模型以实现语音合成;所述中文音节语音合成模型包括:音节音频初始嵌入模块,编码模块、注意力感知模块、预网络、注意力模块、解码模块、后置网络层和线性频谱转换层。本发明可利用声韵母音频合成未有汉字载体的中文音节发音的音频,通过这种方法,即使某些发音没有对应的汉字也能够通过组合声母、韵母和声调来合成相应的音节,这不仅能够丰富中文语音合成的技术和应用,还能够为语言学研究提供新的工具和视角。
📄 2024115551053
📂 G10L13_027
👤 华侨大学
📅 2024-11-04
本发明公开了一种基于深度学习的海豚声音生成方法,属于声音合成技术领域,本发明中采用EMD分解算法对海豚原始声音进行分解,得到多个EMD原始信号,每个EMD原始信号包含部分声音特征,再提取奇异值和时频特征,实现获取每个EMD原始信号的声音特征,采用深度学习模型处理奇异值特征矩阵和时频特征矩阵,生成EMD估计信号,将多个EMD估计信号进行叠加组合,得到海豚声音。本发明中将海豚原始声音进行了分解,使得每个EMD原始信号仅包含海豚原始声音的部分特征,数据量更少,复杂度更低,能提高生成海豚声音的精度。
📄 2024100915324
📂 G10L13_027
👤 广东海洋大学
📅 2024-01-23