柿子坊
· 知识产权运营
首页
专利交易
价值评估
13280638997
登录
注册
首页
>
专利交易
>
专利详情
发明专利
已授权
基于语音驱动的数字人构建方法
📄 申请号:CN202411023067.7
📄 发布日:2025/11/17
著录项目信息
申请日
2024-07-29
公开号
CN119049468B
公开日
2025-03-21
申请人
淮阴工学院
法律状态
已下证
专利类型
发明
主分类号
G10L15_25
IPC 分类号
G10L15_25
,
G10L19_00
,
G10L19_008
,
H04L41_16
,
技术画像
所属领域
人工智能算法
人工智能算法
语音合成
计算机图形学
应用场景
虚拟主播, 智能客服, 在线教育, 元宇宙, 虚拟偶像
AI 智能推荐
·
同申请人专利
·
搜索相似专利
摘要
本发明公开了一种基于语音驱动的数字人构建方法,通过改进wav2lip模型的音频编码器、人脸编码器以及人脸解码器,用深度可分离卷积DSC和时频分解机制TFD优化音频编码器,减少模型的参数数量与计算量,同时增强模型捕捉关键特征的能力。通过添加特征金字塔FPN进一步提升人脸编码器对多尺度面部信息的处理能力,尤其是在捕捉嘴型动作和面部表达的细微变化方面的能力。此外,采用多尺度生成策略提高人脸解码器输出图像的清晰度和细节表现。整体系统还包括一个音唇同步判别器和视觉质量判别器,分别用于确保唇形动作与音频的高度同步和优化生成图像的视觉质量,从而实现更自然、更精确的数字人交互体验。
权利要求书 (12项)
说明书
附图
……
……
图1
图2
图3
法律状态时间线
高温碳化氮掺杂核壳结构活性炭复合电极的制备方法
当前第 / 件
一种基于图像检测的稻种识别和计数方法
同领域国内专利 · IPC: (G10L15_25)
G10L15_00
G10L15_01
G10L15_02
G10L15_04
G10L15_05
G10L15_06
G10L15_08
G10L15_10
G10L15_16
G10L15_18
G10L15_20
G10L15_22
G10L15_24
G10L15_25
G10L15_26
G10L15_30
覆盖
16
个领域
相似专利推荐
AI 驱动 · 同领域
语音实时驱动虚拟人的方法、系统及存储介质
¥0.0
2021114000261 · 北京影创信息科技有限公司
一种基于文本动态生成教学视频的编辑方法
¥0.0
2023103806413 · 淮阴工学院
基于惯性动捕的人-机器人虚实交互控制系统
¥0.0
2017104121723 · 南京邮电大学
议价
不含过户费
委托平台代购
📋 交易方式:
委托待转让
📌 交易状态:
在售
👁️ 浏览次数:112
❤️ 收藏人数:93
📋 项目申报:
未申报
资金托管
权属尽调
包过户
🏢 淄博智来知识产权服务有限公司
✓ 企业认证
✓ 手机绑定
历史成交 3件
好评率 98.5%
📊 出价记录 (3条)
王**
¥-10万
李** 企业
¥-8万
陈**
¥-3万
查看全部出价
我要出价 (议价)
预约谈判