发明专利 已授权

基于语音驱动的数字人构建方法

📄 申请号:CN202411023067.7 📄 发布日:2025/11/17

著录项目信息

申请日
2024-07-29
公开号
CN119049468B
公开日
2025-03-21
申请人
淮阴工学院
法律状态
已下证
专利类型
发明
主分类号
IPC 分类号

技术画像

应用场景

虚拟主播, 智能客服, 在线教育, 元宇宙, 虚拟偶像

摘要

本发明公开了一种基于语音驱动的数字人构建方法,通过改进wav2lip模型的音频编码器、人脸编码器以及人脸解码器,用深度可分离卷积DSC和时频分解机制TFD优化音频编码器,减少模型的参数数量与计算量,同时增强模型捕捉关键特征的能力。通过添加特征金字塔FPN进一步提升人脸编码器对多尺度面部信息的处理能力,尤其是在捕捉嘴型动作和面部表达的细微变化方面的能力。此外,采用多尺度生成策略提高人脸解码器输出图像的清晰度和细节表现。整体系统还包括一个音唇同步判别器和视觉质量判别器,分别用于确保唇形动作与音频的高度同步和优化生成图像的视觉质量,从而实现更自然、更精确的数字人交互体验。
权利要求书 (12项) 说明书 附图

……

……

图1
图2
图3

法律状态时间线

议价
不含过户费

📋 交易方式: 委托待转让 📌 交易状态: 在售 👁️ 浏览次数:112 ❤️ 收藏人数:93 📋 项目申报: 未申报

资金托管 权属尽调 包过户
🏢 淄博智来知识产权服务有限公司
✓ 企业认证✓ 手机绑定历史成交 3件好评率 98.5%

📊 出价记录 (3条)
王**¥-10万
李** 企业¥-8万
陈**¥-3万
查看全部出价