本发明涉及一种基于分阶段交叉训练的唇语识别方法及系统。所述方法包括:基于端到端的训练方式获取第一阶段编码网络参数、解码网络参数;第二阶段根据单一身份数据训练模型,生成存在过拟合的编码网络以及解码网络的初始化参数,利用编码网络初始化参数自适应生成解码网络加权正则化约束,利用解码网络初始化参数自适应生成编码网络加权正则化约束。本发明方法通过此种交叉训练的方式保证编码网络与解码网络的独立性,以此提高唇语识别网络的泛化能力,进而在将本发明训练好的唇语识别模型应用于唇语识别时,能够提高对未知说话人唇语识别的鲁棒性和准确率。
📄 2022100257797
📂 G06V40_20
👤 西安邮电大学
📅 2022-01-11
本发明属于物流无人机技术领域,具体涉及一种基于人体姿态识别的物流无人机及人机物流交互系统。本发明能够对货主进行人体姿态识别,判断货主是否处于收货姿态,从而来决定落货方式,结合落货参数的设置,使得无人机能够在悬停或者携带货物降落至地面后安全的解除对货物的限制,不仅能够保证货物完好,还能够保证货主在接货时能逐渐适应货物重量,避免货物砸伤货主的情况发生,此过程中,根据货主的动作信息来对其姿态进行预测,实现自主判定落货方式的目的,同时还能够根据预测姿态实时调整无人机的悬停位置,使得货主能够更为便捷的取走货物。
📄 2023104999930
📂 G06V40_20
👤 南京弘伍软件技术有限公司; 桂林电子科技大学
📅 2023-05-06
本发明提供一种网络直播主播的行为识别方法、系统、设备及存储介质。该网络直播主播的行为识别方法包括:获取网络直播视频数据;利用时序评估模块检测网络直播视频数据中的主播时序动作,以生成第一主播动作序列数据;利用线性条件随机场推理主播动作序列,以生成第二主播动作序列数据;以及基于第二主播动作序列数据,利用多分类支持向量机进行主播行为识别与概要描述。
📄 2021106776232
📂 G06V40_20
👤 北京工业大学
📅 2021-06-18
本发明公开了一种基于动作捕捉的儿童跌倒智能监控方法,涉及智能防护技术领域,包括,采集儿童活动视频并进行姿态估计,形成连续活动帧序列;将连续活动帧序列进行双通道并行处理,获取骨骼运动特征和躯干运动特征;对骨骼运动特征进行频谱分析和瞬时速度计算,获取下肢骨骼点速度,同步对躯干运动特征进行稠密光流计算,生成躯干光流速度;根据儿童跌倒风险值,对儿童的活动状态进行实时姿态追踪和周围环境扫描,并采集运动轨迹数据;基于运动轨迹数据进行危急分级响应,输出智能防护方案。本发明通过双通道并行处理架构和时空行为分析模型,实现了多维运动特征的协同感知和跌倒前兆的失衡过程的精准捕捉,提升了跌倒预警的时效性。
📄 202511418367X
📂 G06V40_20
👤 吉林工程技术师范学院
📅 2025-09-30
本发明公开了一种动作识别方法,包括:步骤1):通过设备获取图片序列集;步骤2):构建深度学习目标检测网络,将图片序列集输入到检测网络中,获得检测框集;步骤3):将检测框集转化为时空图;步骤4):获取图片、设备ID号、图像时间戳,并结合时空图,进行轨迹生成和轨迹数组对比;步骤5):通过时空图和轨迹数组的信息对轨迹数组进行更新,确认动作;步骤6):根据时间戳对轨迹数组进行接力更新,让轨迹数组保持动态性;该动作识别方法智能、高效、准确,可嵌入到任何场景和神经网络中,具有高度的模块化。
📄 2021112240792
📂 G06V40_20
👤 广州微林软件有限公司
📅 2021-10-21
本发明提供一种手持物品的多目标跟踪和行为判定的装置和方法,整个系统分为成像模块、标注模块、训练模块,识别模块、轨迹跟踪模块、行为判定模块。通过网络摄像头获取图像,图像数据上传至服务器,由运行在服务器中的程序,判定是否是人手持物品,并最终判定是放物品,还是取物品。该装置和方法通过将手掌,手掌‑手持物品,物品三种目标分情况检测,并通过检测逻辑,在不更改检测算法的前提下,提升识别率。在行为判定阶段,通过行为判定逻辑,剔除错误轨迹,提升正确率。
📄 2020107575490
📂 G06V40_20
👤 广州微林软件有限公司
📅 2020-07-31
本发明涉及图像处理技术领域,具体涉及一种羊群异常行为识别方法,包括:获得若干张羊群进食图像;获取同一只羊在不同羊群进食图像的位置;获取每只羊的进食欲望;根据每只羊的进食欲望和进食时长以及进食次数,获取每只羊的健康指数;根据所有羊的健康指数实现对羊群异常行为的识别。本发明通过羊的进食欲望反映羊进食的积极性;综合每只羊的进食欲望和进食时长以及进食次数,计算羊的健康指数;通过羊的进食过程是否出现异常反映羊的健康状况,帮助用户简单及时地了解羊群进食过程中是否发生异常,及时发现羊群中的不健康羊,实现对羊群异常行为的识别。
📄 202411147095X
📂 G06V40_20
👤 昆明易兴恒畜牧科技有限责任公司
📅 2024-08-21
本发明公开了一种基于毫米波雷达的多视觉多穿戴下的开集步态识别方法,包括获取人体步态信息采集雷达回波信号,并针对获取的回波信号进行预处理,同时构建频谱图集;构建基于毫米雷达的步态识别网络模型;采用构建的频谱图集,通过联合计算若干个损失函数,训练、优化构建的基于毫米雷达的步态识别网络模型;设置开集模型样本库,采用训练、优化后的基于毫米雷达的步态识别网络模型,基于回波信号,完成步态识别处理;本发明方法的准确率提高、实际应用性增强、鲁棒性增强。
📄 2024103644979
📂 G06V40_20
👤 中南大学
📅 2024-03-28
本发明涉及动作识别技术领域,具体涉及一种基于长短期时间差分的动作识别视觉转换方法,通过建立LSMD框架,并在该LSMD框架的设计过程中遵循了图像模型,同时,在该图像模型中分别设计了LMIM和SMIF,使得两种不同但互补的方式能够让图像模型获得长短期时间信息,从而使得该图像模型获得时空建模能力,并且为SMIF设计时差抑制方法减少了因省略片段之间的时间差而产生的噪声干扰,能够更有效地捕捉短期时间元素,另外,LMIM的使用能够捕获视频活动的长期时间动态,而无需额外参数或增加计算需求,解决了现有的基于3D视频的任务,如果直接应用时空变换的视频数据会导致补丁数量以及自注意计算的二次复杂度的大幅增加,从而会导致计算和内存负担加重的技术问题。
📄 2024107272424
📂 G06V40_20
👤 南宁师范大学
📅 2024-06-06
本发明公开了一种基于动态实例交互头的稀疏时序动作检测方法。本发明使用基于查询的方法,初始化N个提案特征和提案框,解决了锚框的复杂性问题。本发明还引入了基于时序特征金字塔的动态实例交互头模块,使用时序特征金字塔可以对不同尺度的行为都能进行较好的预测,解决由于每个行为时间跨度不同对实验结果造成的影响;动态实例交互头模块仅仅将提案特征与局部特征进行稀疏交互,就可以很好的学习有价值的信息,大大减少了计算量。最后,使用基于集合预测损失的最佳二分匹配,可以一对一的进行标签匹配,而且最后仅仅输出与初始提案框相等数量的N个候选框,在计算性能之前不用使用非极大值抑制后处理,可以直接作为预测框进行输出。
📄 2022105794219
📂 G06V40_20
👤 杭州电子科技大学
📅 2022-05-25
本发明公开了一种基于骨骼信息的分组混淆图卷积动作识别方法。本发明采用了一种分组的思想,在进行空间操作的时候,我们对动态图进行分组来提取不同图结构的信息,获得丰富的行为信息。同时分组的形式还可以降低模型的参数量。然后在时序上进行操作的时候,采用深度可分离卷积的形式来降低参数和计算量。由于在空间和时序上都是采用分组的形式,所以需要对不同分组的信息进行融合,以达到信息的流通。结果显示本方法在保持高性能的情况下,参数量和计算量有着大幅的减小,证明了本方法有效性。
📄 2021106470354
📂 G06V40_20
👤 杭州电子科技大学
📅 2021-06-10
本发明涉及图像识别技术领域,具体涉及基于时空G‑T的双流动作识别系统及方法,包括输入特征图数据,基于空间自适应图卷积网络模块训练,得到训练数据;使用时间卷积网络模块提取特征,作出类别预测,得到第一分数;利用空间变换器模块提取身体所有节点的查询向量、索引向量和值向量;时间变换器模块提取单个节点所有帧的查询向量、索引向量和值向量;将空间变换器模块输出作为时间变换器模块输入,提取特征,做出类别的预测,得到第二分数;将第一分数和第二分数相加,得到融合分数,预测动作标签,该方法通过信息融合,它们可以相互学习特征信息,通过最大化两类动作表征之间的相互信息来丰富动作特征,提高准确率。
📄 2024107290047
📂 G06V40_20
👤 南宁师范大学
📅 2024-06-06