摘要
本发明提出一种基于Transformer的孪生多模态目标跟踪方法,获取场景中的RGB图像信息和热力图像信息;通过预训练的ResNet网络提取不同模态的高级特征,同时基于孪生网络的跨模态特征融合网络以获得不同模态的共同特征;然后将对应模态的高级特征输入到针对多模态设计的Transformer模块中进行跨模态信息融合,再输入到基于全连接卷积神经网络的回归网络中进行最终检测框的回归,在此过程中产生的误差将会反向传播到前序各个网络中,根据最终权重网络构建目标跟踪网络,以对多模态情况下的目标进行跟踪。本发明可准确预测物体在各模态的位置信息,提高目标跟踪与定位准确度,可广泛应用于多种场景。