本发明公开了面向智能电梯乘客意图分析的视频分类方法及系统,属于计算机视觉领域。所述方法首先利用自监督模型生成像素级的对象的mask作为以对象为中心的表示,并通过对每个对象的mask进行位置编码获得对象的位置信息;将实例的外观信息和位置信息聚合后的特征在时间维度进行推理,理解不同对象之间的交互和关系,与采用视频编码器提取的RGB视频帧的语义特征进行融合,增强了基于对象的特征和整体视频语义之间的互补性和有效性,可以显著提高模型在行为识别任务中的准确性和鲁棒性,能够更好地适应电梯场景乘客意图识别,更加准确地识别和分析乘客是否有乘坐电梯的需求,提供更智能化的电梯系统。
📄 2024103311097
📂 G06V20_40
👤 苏州科技大学
📅 2024-03-22