一种基于多粒度跨模态对比学习的连续手语识别方法,首先充分挖潜手语视频与对应手语文本之间的隐性语义映射关系;接着利用多粒度跨模态对比机制去缓解冗余帧和语义无关标识词对跨模态对齐的潜在影响,通过粗粒度视频‑句子对比与细粒度帧‑词对比策略,从全局和局部角度对视觉与文本模态的特征进行有效对齐,通过跨粒度视频‑词对比和跨粒度帧‑句子对比策略来缓解冗余帧和语义无关标识词带来的语义干扰;最后利用视觉编码器中获得的视觉嵌入,通过解码器获得手语文本句子,作为预测的连续手语识别结果。本发明充分挖潜手语视频与对应手语文本之间的隐性语义映射关系,增强了手语模型对视觉上下文的语义理解,提高了手语识别的适用性和准确性。
📄 2025100094897
📂 G06V40_20
👤 浙江工业大学
📅 2025-01-03
本发明提供了一种基于特定信息的高效跨模态人群计数方法,属于深度学习和计算机视觉技术领域。解决了低照度环境下人群计数精度不高,误差较大的技术问题。其技术方案为:使用热红外图像作为RGB图像信息的补充,通过探索模态共享信息和特定信息的表达,充分结合两种模态的互补特征和各自的特有特征,有效提高在低照度环境下人群计数的精度。本发明的有益效果为:本发明的方法用于学习和融合两种模态特征的表示,以增强对光照不足问题的鲁棒性,从而提高人群计数的准确率。
📄 2023113313342
📂 G06V20_52
👤 南通大学
📅 2023-10-13