本发明涉及语音合成技术领域,具体公开了一种基于少量样本的说话人适应方法、语音翻译方法和系统,包括获取具有文本标注的语音数据,对语音数据进行预处理生成梅尔频谱;构建个性化语音合成模型,将梅尔频谱和文本输入个性化语音合成模型中获得预测梅尔频谱;基于梅尔频谱和预测梅尔频谱预训练个性化语音合成模型,并进行微调;获取目标说话人的语音和任意文本信息,对目标说话人的语音进行预处理以获得梅尔频谱;将梅尔频谱和任意文本信息输入训练好的个性化语音合成模型中,以获得预测梅尔频谱;基于预测梅尔频谱生成任意文本信息所对应的目标语音;该方法将语音中的内容特征和话人特征分离开,解决少量样本语音合成的说话人相似度低的问题。
📄 2023105803195
📂 G10L13_02
👤 澳克多普有限公司
📅 2023-05-23
已申报项目
本发明公开了一种基于变分自编码器的语音刺激连续统合成方法及装置,所述方法包括:从原始语音信号中提取关键声学线索;基于变分自编码器进行关键声学线索建模,并进行训练;利用训练好的关键声学线索模型合成语音连续统。所述装置包括:提取模块,用于从原始语音信号中提取关键声学线索;模型建立模块,用于基于变分自编码器进行关键声学线索建模,并进行训练;合成模块,用于利用训练好的关键声学线索模型合成语音连续统。本发明通过深度学习模型来合成感知实验中所需要的语音刺激连续统,能够解决现有技术中手动修改造成的信息损失和不自然的问题。
📄 2021108413924
📂 G10L13_02
👤 澳克多普有限公司
📅 2021-07-26
已申报项目
本发明公开了一种面向DAS系统的高质量音频生成方法,对低质量、高质量音频数据进行预处理及特征提取,分别得到集合多个短时间帧的音高特征‑梅尔频谱特征数据对的数据集D1和D2;构建包括多通道输入的生成网络和判别网络的高质量音频生成模型;用D2训练生成网络以学习高质量音频的先验分布;判别网络对生成网络的生成信号进行判断,若损失函数小于设定阈值,则结束训练,反之则优化生成网络与判别网络,重复训练;再用D1和D2训练高质量音频生成模型;对待处理的低质量音频进行预处理和特征提取后,输入训练好的高质量音频生成模型,得到高质量音频。本发明提高了音频信号的空间分辨率和一致性,能够更精确地进行高质量音频的生成。
📄 2024116262991
📂 G10L13_027
👤 浙江工业大学
📅 2024-11-14
本发明公开了一种生成式对抗网络的情感语音自动生成方法,包括:(1)准备语音数据集、语音情感数据集以及语言数据集;(2)利用语音数据集训练基于ResCNN构建的声纹识别模型,利用语音情感数据集训练基于CNN构建的语音情感识别模型,利用语言数据集训练语音生成模型;(3)以多个语音生成模型作为生成器,以声纹识别模型和语音情感识别模型作为判别器,构成生成式对抗网络,利用语音数据集、语音情感数据集以及语言数据集对生成式对抗网络进行再训练,获得能够生成特定身份特定情感语音的语音生成模型。(4)利用该语音生成模型自动生成情感语音。该方法可以使生成的语音更加自然且带有情感色彩身份信息。
📄 2020101114344
📂 G10L13_02
👤 浙江工业大学
📅 2020-02-24
一种端到端实时语音合成方法,通过对音频和文本数据进行预处理,整理成平行语料,通过词嵌入转换成特征向量,输入到基于高斯混合模型注意力机制的序列到序列生成模型,以生成预测的梅尔谱;将梅尔谱进行归一化处理,输入到基于生成对抗网络的声码器后端,经过对抗训练来提升合成语音的质量,最后输出合成语音。本发明方法在保证合成语音的质量的同时,可以提高注意力机制的对齐速度,并且在长语音的合成中表现优秀;通过对音频进行分频带编码,可以提高模型的训练速度,降低语音生成时耗,同时使用多尺度短时傅里叶变换损失函数,提高合成语音的质量与实时率。
📄 2021107679899
📂 G10L13_02
👤 浙江工业大学
📅 2021-07-07
本发明公开了一种基于语义注意力机制的多音字发音纠错方法及装置,包括:获取文本数据,并对文本数据进行编码得到字嵌入向量矩阵;构建包含编码器、语义注意力机制单元和解码器的语音合成模型并进行参数优化,其中,编码器用于将输入的字嵌入向量矩阵编码成字嵌入特征矩阵,语义注意力机制单元用于将每个字嵌入向量按照各自权重拆分成疑问部分、关键部分以及价值部分这三部分后,依据相邻字组的三部分计算相邻字组的相关性,以组成关联矩阵;解码器对输入的字嵌入向量矩阵和关联矩阵进行解码处理,输出梅尔线性谱;利用参数优化后的语义合成模型对文本数据进行语音合成,输出梅尔线性谱,依据梅尔线性谱计算得到多音字发音纠错的语音合成结果。
📄 2021102667096
📂 G10L13_02
👤 浙江工业大学
📅 2021-03-11
本发明公开了一种基于STARWGAN‑GP和x向量的多对多说话人转换方法,包括训练阶段和转换阶段,使用了STARWGAN‑GP与x向量相结合来实现语音转换系统。本方法加入了表征性能和实用性能更好的X‑vector向量来表征说话人的个性化特征,并且使用WGAN‑GP来替换GAN,从而解决GAN训练不稳定、梯度消失等问题,构建训练更加稳定、收敛速度更快的网络,进一步提升转换后语音的个性相似度和语音质量,实现了一种高质量的语音转换方法。本方法不仅能够解除对平行文本的依赖,实现非平行文本条件下的语音转换,还可以进一步将多个源‑目标说话人对的转换系统整合在一个转换模型中,即实现多说话人对多说话人转换。
📄 201910030577X
📂 G10L13_02
👤 南京邮电大学
📅 2019-01-14
本申请涉及人工智能中的语音处理,提供一种语音合成方法、装置、服务器及存储介质,该方法包括:调用待训练的语音合成模型;将语音样本输入参考编码器进行编码处理,以提取语音数据的韵律特征向量和音色特征向量;将韵律特征向量、音色特征向量以及文本特征向量输入嵌入层进行叠加操作,得到目标特征向量;将目标特征向量输入解码器进行解码处理,以获取语音数据的预测梅尔频谱;根据预测梅尔频谱和语音数据的真实梅尔频谱,调整语音合成模型的模型参数,直至语音合成模型收敛;将待合成语音的目标语音情绪标签和目标身份标签输入至收敛的语音合成模型,得到梅尔频谱;根据梅尔频谱生成目标语音信息。本申请提高语音合成的效率。
📄 2021103423991
📂 G10L13_02
👤 平安科技(深圳)有限公司
📅 2021-03-30
本发明公开了一种基于改进Tacotron2模型的中文音节语音合成方法与系统,涉及语音合成技术领域,方法包括如下步骤:构建并训练中文音节语音合成模型;将待合成的音素音频输入训练好的中文音节语音合成模型以实现语音合成;所述中文音节语音合成模型包括:音节音频初始嵌入模块,编码模块、注意力感知模块、预网络、注意力模块、解码模块、后置网络层和线性频谱转换层。本发明可利用声韵母音频合成未有汉字载体的中文音节发音的音频,通过这种方法,即使某些发音没有对应的汉字也能够通过组合声母、韵母和声调来合成相应的音节,这不仅能够丰富中文语音合成的技术和应用,还能够为语言学研究提供新的工具和视角。
📄 2024115551053
📂 G10L13_027
👤 华侨大学
📅 2024-11-04
本发明公开了一种在非平行语料训练条件下基于VAE的语音转换方法,在非平行文本条件下,通过深度神经网络提取瓶颈特征,即Bottleneck特征,然后基于变分自编码模型实现转换函数的学习与建模,在转换阶段,可以实现多说话人对多说话人的转换。本发明的优势有三个方面:1)解除对平行文本的依赖,而且训练过程不需要任何对齐操作;2)可以将多个源‑目标说话人对的转换系统整合在一个转换模型中,实现多对多转换;3)非平行文本条件下的多对多转换系统将为该技术走向实际语音交互提供技术支撑。
📄 201810393556X
📂 G10L13_02
👤 南京邮电大学
📅 2018-04-27
本发明涉及一种基于通信网络的视频拍摄时的音频同步方法,包括:音频采集设备将音频信息打包为数据包后通过无线通信网络发送给视频拍摄设备;视频拍摄设备将每一音频采集设备的数据包分别恢复为一轨音频信号;当音频电平最大值之和大于预设值时,对各轨音频信号进行衰减;最后将各轨音频信号进行叠加合成得到合成音频信号。本发明中,音频采集设备通过无线通信网络向视频拍摄设备传输音频信息,音频信息传输便捷,且可以进行无损音频的传输,确保音质效果;采用多个音频采集设备能够对各个发声点进行近距离的采集,从而可以获得更好的音质效果;通过对各轨音频信号进行衰减,可以降低合成音频信号的最大电平,避免音频信号电平过高产生失真。
📄 2022111365456
📂 G10L13_02
👤 深圳市野草声学有限公司
📅 2022-09-19
本发明公开了一种基于深度学习的海豚声音生成方法,属于声音合成技术领域,本发明中采用EMD分解算法对海豚原始声音进行分解,得到多个EMD原始信号,每个EMD原始信号包含部分声音特征,再提取奇异值和时频特征,实现获取每个EMD原始信号的声音特征,采用深度学习模型处理奇异值特征矩阵和时频特征矩阵,生成EMD估计信号,将多个EMD估计信号进行叠加组合,得到海豚声音。本发明中将海豚原始声音进行了分解,使得每个EMD原始信号仅包含海豚原始声音的部分特征,数据量更少,复杂度更低,能提高生成海豚声音的精度。
📄 2024100915324
📂 G10L13_027
👤 广东海洋大学
📅 2024-01-23