法律状态: 全部 已授权 审中
项目申报: 全部 报过 没有报过
4 件在售专利
本申请提供了一种触发语音交互响应的方法及设备,能够接收用户语音并识别出关键词,再获取该关键词对应的唇部变化图像序列,进一步对该唇部变化图像序列与该关键词进行匹配,得到匹配置信度,如果匹配置信度符合预先定义的语音交互响应规则,则触发语音交互响应,从而提高了响应的准确率,降低了语音交互响应的误触发率,提升了用户体验。
📄 2019112614774 📂 G10L15_25 👤 上海芯翌智能科技有限公司 📅 2019-12-10
已申报项目
¥0.0
本发明公开了一种结合视频信号的多通道卷积混叠语音信道估计方法,引进新型数学工具和分析方法,融合视音频信号信息,实现卷积语音混叠信道的有效估计。该方法借助说话人嘴部区域视频信号,通过非负矩阵分解提取说话人嘴型特征数据;利用密度聚类方法检测说话人嘴部特征数据的聚类中心,检测出说话人嘴部处于静默状态的图像帧,进一步提取单一说话人发声主导的所有时间窗口。根据局部主导时间窗口信息,从时频域观测语音信号成分计算局部主导协方差矩阵,通过特征值分解提取出主导特征向量,从而实现混叠语音信道估计。对比当前较为流行的单模态音频下的混叠语音信道估计方法,从数值实验上证明了所提方法的优越性。
📄 2019108165927 📂 G10L15_25 👤 广东工业大学 📅 2019-08-30
¥0.0
本发明实施例提供了一种语音识别方法、装置、系统、服务器及存储介质,所述方法包括:获取会议中多个发言者的发言图像、语音信号以及每个发言者的声纹信息,其中,语音信号包括多个发言者同时发言所产生的语音信号,对发言图像进行识别,确定每个发言者的方位信息以及唇动信息,针对每个发言者,将该发言者的唇动信息、声纹信息、方位信息以及语音信号输入预先训练完成的语音识别模型,得到该发言者对应的文本信息,其中,语音识别模型为基于多用户语音样本训练得到的,多用户语音样本包括每个用户的唇动信息、声纹信息、方位信息以及多用户同时发言所产生的语音信号。由于不需要将语音信号分离,保证了语音信号的完整,提高了语音识别的准确度。
📄 2021110486425 📂 G10L15_25 👤 杭州海康威视数字技术股份有限公司 📅 2021-09-08
¥0.0
本发明公开了一种基于语音驱动的数字人构建方法,通过改进wav2lip模型的音频编码器、人脸编码器以及人脸解码器,用深度可分离卷积DSC和时频分解机制TFD优化音频编码器,减少模型的参数数量与计算量,同时增强模型捕捉关键特征的能力。通过添加特征金字塔FPN进一步提升人脸编码器对多尺度面部信息的处理能力,尤其是在捕捉嘴型动作和面部表达的细微变化方面的能力。此外,采用多尺度生成策略提高人脸解码器输出图像的清晰度和细节表现。整体系统还包括一个音唇同步判别器和视觉质量判别器,分别用于确保唇形动作与音频的高度同步和优化生成图像的视觉质量,从而实现更自然、更精确的数字人交互体验。
📄 2024110230677 📂 G10L15_25 👤 淮阴工学院 📅 2024-07-29
¥0.0
发明 已授权

触发语音交互响应的方法及设备

2019112614774 · 上海芯翌智能科技有限公司
已申报项目
¥0.0
发明 已授权
发明 已授权

一种语音识别方法、装置、系统、服务器及存储介质

2021110486425 · 杭州海康威视数字技术股份有限公司
¥0.0
发明 已授权

基于语音驱动的数字人构建方法

2024110230677 · 淮阴工学院
¥0.0

求购专区 · 发布技术需求,卖家在线应标

🔋 高能量密度固态电解质材料与制备工艺
预算:¥50-100万截止:2026-08-30发布方:××新能源科技响应:8人

交易保障 · 安心交易

资金托管

买家付款至平台,交易完成/过户成功后放款给卖家

权属尽调

专利有效性分析 + 权属状态核查,确保交易安全

合同审核

标准转让/许可合同模板,支持在线电子签署

全程代办

著录项目变更、备案手续全程代办,省心省力

交易流程 · 六步完成专利交易

1
选专利
2
在线沟通
3
签署合同
4
支付款项
5
办理变更
6
过户完成

成功交易案例

🔬

固态锂电池电解质专利包

转让方:中国科学院××研究所
受让方:××新能源科技有限公司
交易类型:独占许可
交易金额:¥320万
🧬

CRISPR基因编辑技术

转让方:××大学
受让方:××生物医药有限公司
交易类型:转让
交易金额:¥1,200万

SiC功率器件工艺专利

转让方:××半导体有限公司
受让方:××汽车电子集团
交易类型:转让
交易金额:¥680万
☀️

钙钛矿光伏组件技术

转让方:××科技公司
受让方:××能源集团
交易类型:开放许可
交易金额:¥50万/年