一种端到端实时语音合成方法,通过对音频和文本数据进行预处理,整理成平行语料,通过词嵌入转换成特征向量,输入到基于高斯混合模型注意力机制的序列到序列生成模型,以生成预测的梅尔谱;将梅尔谱进行归一化处理,输入到基于生成对抗网络的声码器后端,经过对抗训练来提升合成语音的质量,最后输出合成语音。本发明方法在保证合成语音的质量的同时,可以提高注意力机制的对齐速度,并且在长语音的合成中表现优秀;通过对音频进行分频带编码,可以提高模型的训练速度,降低语音生成时耗,同时使用多尺度短时傅里叶变换损失函数,提高合成语音的质量与实时率。
📄 2021107679899
📂 G10L13_02
👤 浙江工业大学
📅 2021-07-07
本申请涉及人工智能中的语音处理,提供一种语音合成方法、装置、服务器及存储介质,该方法包括:调用待训练的语音合成模型;将语音样本输入参考编码器进行编码处理,以提取语音数据的韵律特征向量和音色特征向量;将韵律特征向量、音色特征向量以及文本特征向量输入嵌入层进行叠加操作,得到目标特征向量;将目标特征向量输入解码器进行解码处理,以获取语音数据的预测梅尔频谱;根据预测梅尔频谱和语音数据的真实梅尔频谱,调整语音合成模型的模型参数,直至语音合成模型收敛;将待合成语音的目标语音情绪标签和目标身份标签输入至收敛的语音合成模型,得到梅尔频谱;根据梅尔频谱生成目标语音信息。本申请提高语音合成的效率。
📄 2021103423991
📂 G10L13_02
👤 平安科技(深圳)有限公司
📅 2021-03-30
本发明涉及人工智能,提供一种语音播报方法、装置、设备及存储介质。该方法能够对用户音频及人脸图像进行特征提取,得到语音特征及图像特征,基于图像特征对语音特征进行注意力分析,得到语音关注特征,基于语音特征对图像特征进行注意力分析,得到图像关注特征,对语音关注特征及图像关注特征进行分析,得到用户情绪,根据用户事件及用户情绪获取推荐信息,在显示屏幕中显示推荐信息,采集多张眼部图像并定位眼球转动角度,根据眼球转动角度及推荐信息在显示屏幕中的位置定位出目标信息,并播报目标信息。本发明能够准确的定位出用户情绪及用户想关注的信息,从而进行准确的播报。此外,本发明还涉及区块链技术,所述目标信息可存储于区块链中。
📄 2021107392723
📂 G06K9_00
👤 平安科技(深圳)有限公司
📅 2021-06-30
本发明公开了一种基于改进Tacotron2模型的中文音节语音合成方法与系统,涉及语音合成技术领域,方法包括如下步骤:构建并训练中文音节语音合成模型;将待合成的音素音频输入训练好的中文音节语音合成模型以实现语音合成;所述中文音节语音合成模型包括:音节音频初始嵌入模块,编码模块、注意力感知模块、预网络、注意力模块、解码模块、后置网络层和线性频谱转换层。本发明可利用声韵母音频合成未有汉字载体的中文音节发音的音频,通过这种方法,即使某些发音没有对应的汉字也能够通过组合声母、韵母和声调来合成相应的音节,这不仅能够丰富中文语音合成的技术和应用,还能够为语言学研究提供新的工具和视角。
📄 2024115551053
📂 G10L13_027
👤 华侨大学
📅 2024-11-04
本发明实施例公开了一种基于车辆的用户发音模拟方法、系统、设备及存储介质。该方法包括:从预先存储的语音数据集中获取目标播放数据;根据车辆环境音,和/或目标播放数据的语义信息,确定与车辆中的播放设备匹配的播放控制参数,播放设备在车辆中的位置与真实人嘴所处位置相匹配;控制播放设备按照播放控制参数,播放目标播放数据。该方法可以通过播放设备播放目标播放数据,代替现有技术发音人上车进行语音采集的方式,可以降低发音模拟成本,实现方式简单,发音模拟高效;通过车辆环境音和/或语义信息确定播放设备的播放控制参数,可以使播放设备的播放质量达到与发音人上车进行语音采集同等质量效果。
📄 2020108811132
📂 G10L15_01
👤 大众问问(北京)信息科技有限公司
📅 2020-08-27
本发明涉及人工智能,公开一种歌曲合成方法,包括:获取歌词朗诵音频和乐谱信息;通过预置语音识别模型和歌词拼音文本对歌词朗诵音频进行时长标注,得到朗诵时长;通过预置声码器从歌词朗诵音频中分析初始声学参数;根据预置声母变速字典、节奏信息和节拍信息从歌词拼音文本中提取歌唱时长;根据预置变速算法、朗诵时长和歌唱时长对初始声学参数进行变速处理;对变速后的频谱包络进行共振峰增强处理,得到增强后的频谱包络;基于音高信息、歌唱时长和变速后的基频进行矫正处理,得到矫正后的基频;通过预置声码器对处理后的声学参数进行歌曲合成处理。本发明还涉及区块链,合成的歌曲存储于区块链中。
📄 2020103502560
📂 G10L13_033
👤 平安科技(深圳)有限公司
📅 2020-04-28
本发明是一种开放性创建语音朗读标准参考模型的方法,用户经过程序测试和系统审核成为专家用户,获得开放性创建朗读语音的标准参考模型的权限和操作,从而让特定的英语文本获得多个标准参考模型,用户进行英语朗读时,其语音特征就可以和多个和用户匹配的标准参考模型比对计算分值,通过对分值进行归一优化,减小因用户朗读单个字母、词的语音特性受上下文的影响改变了重音、音调、音量和发音速度等造成的等评分误差。
📄 2019103049506
📂 G10L15_01
👤 深圳市数字星河科技有限公司
📅 2019-04-16