本发明公开了一种面向DAS系统的高质量音频生成方法,对低质量、高质量音频数据进行预处理及特征提取,分别得到集合多个短时间帧的音高特征‑梅尔频谱特征数据对的数据集D1和D2;构建包括多通道输入的生成网络和判别网络的高质量音频生成模型;用D2训练生成网络以学习高质量音频的先验分布;判别网络对生成网络的生成信号进行判断,若损失函数小于设定阈值,则结束训练,反之则优化生成网络与判别网络,重复训练;再用D1和D2训练高质量音频生成模型;对待处理的低质量音频进行预处理和特征提取后,输入训练好的高质量音频生成模型,得到高质量音频。本发明提高了音频信号的空间分辨率和一致性,能够更精确地进行高质量音频的生成。
📄 2024116262991
📂 G10L13_027
👤 浙江工业大学
📅 2024-11-14
本发明公开了一种生成式对抗网络的情感语音自动生成方法,包括:(1)准备语音数据集、语音情感数据集以及语言数据集;(2)利用语音数据集训练基于ResCNN构建的声纹识别模型,利用语音情感数据集训练基于CNN构建的语音情感识别模型,利用语言数据集训练语音生成模型;(3)以多个语音生成模型作为生成器,以声纹识别模型和语音情感识别模型作为判别器,构成生成式对抗网络,利用语音数据集、语音情感数据集以及语言数据集对生成式对抗网络进行再训练,获得能够生成特定身份特定情感语音的语音生成模型。(4)利用该语音生成模型自动生成情感语音。该方法可以使生成的语音更加自然且带有情感色彩身份信息。
📄 2020101114344
📂 G10L13_02
👤 浙江工业大学
📅 2020-02-24
一种端到端实时语音合成方法,通过对音频和文本数据进行预处理,整理成平行语料,通过词嵌入转换成特征向量,输入到基于高斯混合模型注意力机制的序列到序列生成模型,以生成预测的梅尔谱;将梅尔谱进行归一化处理,输入到基于生成对抗网络的声码器后端,经过对抗训练来提升合成语音的质量,最后输出合成语音。本发明方法在保证合成语音的质量的同时,可以提高注意力机制的对齐速度,并且在长语音的合成中表现优秀;通过对音频进行分频带编码,可以提高模型的训练速度,降低语音生成时耗,同时使用多尺度短时傅里叶变换损失函数,提高合成语音的质量与实时率。
📄 2021107679899
📂 G10L13_02
👤 浙江工业大学
📅 2021-07-07
本发明公开了一种基于语义注意力机制的多音字发音纠错方法及装置,包括:获取文本数据,并对文本数据进行编码得到字嵌入向量矩阵;构建包含编码器、语义注意力机制单元和解码器的语音合成模型并进行参数优化,其中,编码器用于将输入的字嵌入向量矩阵编码成字嵌入特征矩阵,语义注意力机制单元用于将每个字嵌入向量按照各自权重拆分成疑问部分、关键部分以及价值部分这三部分后,依据相邻字组的三部分计算相邻字组的相关性,以组成关联矩阵;解码器对输入的字嵌入向量矩阵和关联矩阵进行解码处理,输出梅尔线性谱;利用参数优化后的语义合成模型对文本数据进行语音合成,输出梅尔线性谱,依据梅尔线性谱计算得到多音字发音纠错的语音合成结果。
📄 2021102667096
📂 G10L13_02
👤 浙江工业大学
📅 2021-03-11
本发明公开了一种基于STARWGAN‑GP和x向量的多对多说话人转换方法,包括训练阶段和转换阶段,使用了STARWGAN‑GP与x向量相结合来实现语音转换系统。本方法加入了表征性能和实用性能更好的X‑vector向量来表征说话人的个性化特征,并且使用WGAN‑GP来替换GAN,从而解决GAN训练不稳定、梯度消失等问题,构建训练更加稳定、收敛速度更快的网络,进一步提升转换后语音的个性相似度和语音质量,实现了一种高质量的语音转换方法。本方法不仅能够解除对平行文本的依赖,实现非平行文本条件下的语音转换,还可以进一步将多个源‑目标说话人对的转换系统整合在一个转换模型中,即实现多说话人对多说话人转换。
📄 201910030577X
📂 G10L13_02
👤 南京邮电大学
📅 2019-01-14
本申请涉及人工智能中的语音处理,提供一种语音合成方法、装置、服务器及存储介质,该方法包括:调用待训练的语音合成模型;将语音样本输入参考编码器进行编码处理,以提取语音数据的韵律特征向量和音色特征向量;将韵律特征向量、音色特征向量以及文本特征向量输入嵌入层进行叠加操作,得到目标特征向量;将目标特征向量输入解码器进行解码处理,以获取语音数据的预测梅尔频谱;根据预测梅尔频谱和语音数据的真实梅尔频谱,调整语音合成模型的模型参数,直至语音合成模型收敛;将待合成语音的目标语音情绪标签和目标身份标签输入至收敛的语音合成模型,得到梅尔频谱;根据梅尔频谱生成目标语音信息。本申请提高语音合成的效率。
📄 2021103423991
📂 G10L13_02
👤 平安科技(深圳)有限公司
📅 2021-03-30
本发明公开了一种基于改进Tacotron2模型的中文音节语音合成方法与系统,涉及语音合成技术领域,方法包括如下步骤:构建并训练中文音节语音合成模型;将待合成的音素音频输入训练好的中文音节语音合成模型以实现语音合成;所述中文音节语音合成模型包括:音节音频初始嵌入模块,编码模块、注意力感知模块、预网络、注意力模块、解码模块、后置网络层和线性频谱转换层。本发明可利用声韵母音频合成未有汉字载体的中文音节发音的音频,通过这种方法,即使某些发音没有对应的汉字也能够通过组合声母、韵母和声调来合成相应的音节,这不仅能够丰富中文语音合成的技术和应用,还能够为语言学研究提供新的工具和视角。
📄 2024115551053
📂 G10L13_027
👤 华侨大学
📅 2024-11-04
本发明公开了一种在非平行语料训练条件下基于VAE的语音转换方法,在非平行文本条件下,通过深度神经网络提取瓶颈特征,即Bottleneck特征,然后基于变分自编码模型实现转换函数的学习与建模,在转换阶段,可以实现多说话人对多说话人的转换。本发明的优势有三个方面:1)解除对平行文本的依赖,而且训练过程不需要任何对齐操作;2)可以将多个源‑目标说话人对的转换系统整合在一个转换模型中,实现多对多转换;3)非平行文本条件下的多对多转换系统将为该技术走向实际语音交互提供技术支撑。
📄 201810393556X
📂 G10L13_02
👤 南京邮电大学
📅 2018-04-27
本发明涉及一种基于通信网络的视频拍摄时的音频同步方法,包括:音频采集设备将音频信息打包为数据包后通过无线通信网络发送给视频拍摄设备;视频拍摄设备将每一音频采集设备的数据包分别恢复为一轨音频信号;当音频电平最大值之和大于预设值时,对各轨音频信号进行衰减;最后将各轨音频信号进行叠加合成得到合成音频信号。本发明中,音频采集设备通过无线通信网络向视频拍摄设备传输音频信息,音频信息传输便捷,且可以进行无损音频的传输,确保音质效果;采用多个音频采集设备能够对各个发声点进行近距离的采集,从而可以获得更好的音质效果;通过对各轨音频信号进行衰减,可以降低合成音频信号的最大电平,避免音频信号电平过高产生失真。
📄 2022111365456
📂 G10L13_02
👤 深圳市野草声学有限公司
📅 2022-09-19
本发明公开了一种基于深度学习的海豚声音生成方法,属于声音合成技术领域,本发明中采用EMD分解算法对海豚原始声音进行分解,得到多个EMD原始信号,每个EMD原始信号包含部分声音特征,再提取奇异值和时频特征,实现获取每个EMD原始信号的声音特征,采用深度学习模型处理奇异值特征矩阵和时频特征矩阵,生成EMD估计信号,将多个EMD估计信号进行叠加组合,得到海豚声音。本发明中将海豚原始声音进行了分解,使得每个EMD原始信号仅包含海豚原始声音的部分特征,数据量更少,复杂度更低,能提高生成海豚声音的精度。
📄 2024100915324
📂 G10L13_027
👤 广东海洋大学
📅 2024-01-23
一种基于语音训练克隆口音及声韵方法,公开了以训练文本使用代表不同语调的典型分类文本,经训练后获得用户同一音标几个不同语调下的含口音、声韵的单元,从中提取音素、语音片段单元最为音库内容,比较全面的保留了用户个性化的语音中口音、声韵等特征,克隆模拟语音时,根据文本特征代表的语调和训练经验获得对应的音素组,经过声韵矫正、缓差对齐矫正合成的语音,实现口音及声调的保真克隆。
📄 2019104204161
📂 G10L13_02
👤 深圳市数字星河科技有限公司
📅 2019-05-20
本发明实施例提供一种说话视频的处理方法及装置、设备和存储介质,其中,所述方法包括:获取包含图像的第一文件和包含音频的第二文件;将所述第一文件和所述第二文件输入经过训练得到的说话视频合成模型,得到合成的说话视频,其中,所述说话视频合成模型包括对训练样本进行解离后得到的解离后的身份子空间和解离后的话语子空间;输出所述合成的说话视频。
📄 2018106018134
📂 G10L13_02
👤 北京市商汤科技开发有限公司
📅 2018-06-12