本发明公开了一种基于多模态融合与时空增强网络的无人机行为识别方法,涉及计算机视觉与人工智能技术领域,包括从输入的无人机视频中,利用轻量化姿态估计模型逐帧提取人体关节点坐标,生成初始骨架序列;对初始骨架序列进行增强处理,将增强后的骨架序列输入到双分支时空增强网络进行时空特征提取;从无人机视频中,利用分组视觉模型检测并分割场景中的物体,获取像素级物体掩码及其语义类别;基于检测到的物体,构建时空动态图网络;将时空特征与时空动态图进行跨模态融合;对融合后的特征进行分类,输出最终识别结果。本发明显著提升了低质量视频中行为识别鲁棒性,有效缓解了遮挡和多视角变化带来的干扰,增强了对人‑物交互语义的理解能力。
📄 2025114464391
📂 G06V40_10
👤 青岛科技大学
📅 2025-10-11
本发明涉及自然语言处理、深度学习、多模态情感分析领域,涉及一种基于跨模态动态卷积的视频多模态情感识别方法、装置及计算机设备,所述方法包括使用ERNIE2.0预训练模型、DCCN、ResNet‑152和胶囊网络分别对文本、音频、图像提取出单模态低级特征;使用词对齐对三个模态特征进行对齐;采用双向GRU对上述特征进行处理,得到各模态高级特征;利用跨模态动态卷积对三个模态特征进行交互;拼接各个模态的跨模态交互特征和高级特征,并利用多头注意力机制融合;最后输入到softmax函数中得到情感识别结果;本发明很好的融合了各单模态特征,有效挖掘视频中所表达的情感信息,从而提升了多模态情感识别的准确率及效率。
📄 2022100672427
📂 G06V40_16
👤 重庆邮电大学
📅 2022-01-20
本发明公开了一种基于条件融合的多模态反讽检测方法。本发明具体步骤:步骤1、对需要进行反讽检测的数据文本进行预训练;对数据文本对应的视频和音频进行编码,得到视频特征和音频特征;步骤2、将处理好的数据文本馈送到编码器TE中;将数据的视频特征和音频特征通过多头注意力机制获得与情感相关的语境信息;步骤3、将语境信息以增量参数的形式加入到编码器的层归一化的增益g和偏置b中,将视频、音频特征融合到文本特征中,获得融合后的语义编码;步骤4、将语义编码通过softmax层进行讽刺的极性分类;本发明方法具有更好的鲁棒性和检测能力,解决了评论文本中的反讽检测问题。
📄 2021106599736
📂 G06F16_33
👤 杭州电子科技大学
📅 2021-06-15
基于模态间隐式空间增强和时空交互编码的3D目标检测方法和装置,其方法包括:获取训练数据并构建3D目标检测架构;通过特征提取网络分别获取RGB图像特征和点云特征,将这些特征输入到隐式空间增强融合编码网络中生成包含丰富几何信息的鸟瞰视图图像特征;通过时空交互式特征融合网络,在空间和时间维度上融合图像鸟瞰特征和点云鸟瞰特征以获得最终的多模态融合特征;将所述融合特征送入分类头,实现目标的检测与识别。本发明通过充分挖掘LiDAR点云和RGB图像的互补特性进行高精度目标检测。
📄 202411748988X
📂 G06V20_10
👤 浙江工业大学
📅 2024-12-02
本发明公开了一种基于异构图的多模态教学视频摘要生成方法,包括:获取若干个视频样本形成训练集;建立多模态摘要生成模型并利用训练集训练,模型执行如下操作:分别将视频帧序列和句子序列输入视觉特征提取模型和语言模型,得到视觉特征向量集合和文本特征向量集合形成多模态特征表示;初始化邻接矩阵;将模态内约束矩阵、模态间约束矩阵、邻接矩阵进行哈达玛积,获得优化异构图;执行双阶段融合策略;利用训练好的多模态摘要生成模型输出的多模态统一表示筛选关键视频帧节点集合和关键句子节点集合,并对应保留在优化异构图内的连接关系作为子邻接矩阵,获得多模态摘要图。该方法可生成语义一致、内容丰富的教学视频摘要,泛化能力强。
📄 2025113407936
📂 G06V20_40
👤 浙江工业大学
📅 2025-09-19
本发明公开了一种模型无关的多模态情感分析方法,首先进行有偏多模态情感预测,然后对于非文本模态反事实,采用两个额外的单模态模型来捕获,得到非文本模态下情感预测结果。而对于文本模态反事实,则采取将输入文本关键词中类间分布差异较小的单词掩盖,从而仅保留背景单词和类间分布差异较大的关键词,来作为反事实文本输入,并最后得到文本模态下情感预测结果。最后将有偏多模态情感预测结果减去非文本模态下的情感预测结果和文本模态下的情感预测结果,得到无偏的情感预测结果。本发明能够保持较高的情感分析准确率。
📄 202310685168X
📂 G06F18_25
👤 浙江工业大学
📅 2023-06-09
本发明公开了一种基于多模态融合的视觉问答融合增强方法。本发明步骤如下:1、利用GRU结构构建时序模型,获得问题的特征表示学习、利用从Faster R-CNN抽取的基于自底向上的注意力模型的输出作为图像的特征表示;2、基于注意力模型Transformer进行多模态推理,引入注意力模型对图片-问题-答案这个三元组进行多模态融合,建立推理关系;3、针对不同的隐含关系有不同的推理过程和结果输出,再根据这些结果输出来进行标签分布回归学习,来确定答案。本发明基于特定的图片和问题得到答案直接应用于服务于盲人的应用中,能够帮助盲人或者视觉障碍者更好地感知周围环境,也应用于图片检索系统,提高图片检索的准确性和多样性。
📄 2019105201387
📂 G06F16_332
👤 杭州电子科技大学
📅 2019-06-17
本发明公开一种基于对偶转换网络的多模态情感分类方法。本发明结合对偶学习机制以及自注意力机制,在将一个模态转换为另一个模态的过程中,挖掘模态对之间具有方向性的长时交互的跨模态融合信息。同时,对偶学习技术能够增强模型的鲁棒性,因此能很好地应对多模态学习中存在的固有问题——模态数据缺失问题。其次,在此基础上构建的分层融合框架,将所有具有同一个源模态的跨模态融合信息拼接在一块,从而采用一维卷积层进行融合操作,能够进一步挖掘多模态信息之间的高层次互补信息,是对当前情感识别领域的多模态融合框架的有效补充。
📄 2020115813734
📂 G06F16_906
👤 杭州电子科技大学
📅 2020-12-28
本发明实施例公开了一种用于实现图文匹配的方法、装置、电子设备以及计算机可读介质,其中,用于实现图文匹配的方法主要包括:获取一组图像和文本;利用第一卷积神经网络获取所述图像的图像特征,并利用第一递归神经网络获取所述文本中的各词语特征;针对所述图像特征和所述各词语特征进行语义注意力处理,得到语义注意力值;根据所述语义注意力值,计算所述图像和所述文本的匹配程度。本发明实施例在一定程度上提高了图文匹配的准确性。
📄 2017104536647
📂 G06F16_583
👤 北京市商汤科技开发有限公司
📅 2017-06-15
本发明涉及一种基于多模态的情绪识别方法及系统,该系统能够通过综合分析多种生物测量数据,准确地识别和分类用户的情绪状态。该系统包括一个传感器阵列,用于从用户那里收集包括脑电信号、面部图像和语音数据在内的生物测量数据。这些数据首先被数据处理单元接收,并进行预处理,包括应用傅里叶变换生成功率谱密度剖面,使用基于Adaboost的算法从面部图像中检测面部特征,以及从语音数据中提取梅尔频率倒谱系数。接着,通过一个多模态集成算法,将各种处理后的数据特征结合成一个统一的特征向量。此向量随后被一个训练过的深度学习模型使用,根据预定义的情绪类别进行情绪分类,并生成情绪识别结果,最后通过输出单元显示。
📄 2024107113343
📂 G06F18_241
👤 广东海洋大学
📅 2024-06-04
本发明涉及自然语言处理技术领域,特别涉及一种多模态情感检测方法、装置、计算机设备以及存储介质,通过文本至图像模态交互网络以及图像至文本模态交互网络中多层模态交互层进行特征提取,捕获文本和图像模态中复杂的、多样的情感信息,实现模态间和模态内的情感信息交互,用以进行情感检测,提高多模态情感检测的精准性以及效率。
📄 2024111393493
📂 G06F18_25
👤 华南师范大学
📅 2024-08-20
本发明涉及自然语言处理技术领域,特别涉及一种多模态嘲讽检测方法,采用单模态门控注意力特征提取方法,提取文本级以及图像级的门控自注意力特征表示,采用跨模态图推理方法,捕捉局部配准和全局配准之间的不一致性关系,以识别跨模态级的图推理特征,结合文本级、图像级的门控自注意力特征表示以及跨模态级的图推理特征进行嘲讽识别,从而识别出更复杂的跨模态嘲讽特征和跨模态级的不一致性信息对文本和图像表示进行重构,充分考虑到了文本和图像模态之间的差距问题以及文本和图像传达的信息存在的不一致性问题,提高多模态嘲讽检测的精准性以及效率。
📄 202410101338X
📂 G06F18_213
👤 华南师范大学
📅 2024-01-25