本发明公开了一种渐进式多模态语义对齐的教学视频内容提炼方法,属于视频摘要生成技术领域,包括:对教育视频进行采样,获得视频帧序列和对应句子序列;将视频帧序列输入视觉特征提取模型获取视频帧特征表示,将句子序列输入文本特征提取模型获取句子特征表示;建立渐进式多模态语义对齐模型;将待提炼的教学视频得到的视频帧序列、句子序列、视频帧特征表示和句子特征表示输入渐进式多模态语义对齐模型,获得细粒度视频帧摘要集合和细粒度文本摘要集合即为从教学视频提炼出的摘要内容。该方法能够有效地利用多模态间的语义关联,生成更精准、流畅的教学视频摘要内容。
📄 2025113817199
📂 G06V20_40
👤 浙江工业大学
📅 2025-09-25
本发明公开了一种基于互信息的图文对齐方法,首先构建包括特征提取模块和特征对齐模块的图文对齐网络模型,所述特征提取模块包括图像特征提取模块和文本特征提取模块,分别用于提取图像特征和文本特征,所述特征对齐模块用于计算对齐损失,所述对齐损失包括为模态内损失和模态间损失。然后对构建的图文对齐网络模型进行训练,将待对齐的图像和文本输入训练好的图文对齐网络模型,得到图像对应文本排序或文本对应的图像排序,实现图像与文本的对齐。本发明充分利用图文数据间的互信息,对齐难以区分的图像文本对,提高图文对齐性能。
📄 2022114248030
📂 G06T11_60
👤 浙江工业大学
📅 2022-11-14
本发明公开了一种基于图片和句子的多模态联合事件检测方法,同时从图片和句子中识别事件。本发明一方面利用现有的单模态数据集分别学习图片和文本事件分类器;另一方面利用已有的图片与标题对训练图片句子匹配模块,找出多模态文章中语义相似度最高的图片和句子,从而获取图片实体和单词在公共空间的特征表示。这些特征有助于图片和文本事件分类器之间共享参数,得到共享事件分类器。最后,利用少量的多模态标注数据对模型进行测试,利用共享事件分类器分别获取图片和句子描述的事件及其类型。本发明从图片和句子中识别事件,利用视觉特征和文本特征的互补性,不仅提高了单模态事件分类的性能,而且可以发现文章中更完整的事件信息。
📄 2021106606922
📂 G06F16_35
👤 杭州电子科技大学
📅 2021-06-15
本发明公开一种跨模态注意力机制的食品营养成分含量预测方法及系统,包括:对食品图像样本集标注营养成分及含量,以此对预测模型进行训练;对待测食品图像进行多模态特征提取,对每个模态的特征映射图进行注意力映射,得到权重映射图,将任意一个模态的特征映射图与其他模态的权重映射图进行外积,将外积结果与该模态的特征映射图进行相加,以此进行特征融合;根据融合后的特征图,采用预测模型得到待测食品图像中每种营养成分的含量。通过提取食品图像的多模态特征;同时采用注意力多模态特征融合的方式进行营养成分含量的预测,提升预测精度与速度。
📄 2022100272104
📂 G06V20_68
👤 山东师范大学
📅 2022-01-11
本发明提出一种基于属性的多模态可解释分类的方法与系统,通过批归一化通道交换及邓普斯特‑谢弗理论,利用多模态数据的互补能力,有效提高分类准确性;根据对象具有的属性以及决策树推理规则对预测结果进行解释,运用不同的损失函数描述对象在决策树叶层级和内部层级的推理损失,以及分类属性原型在决策树叶层级和内部层级的损失;进行训练时,将多模态分类数据集输入至模型中,反向传播训练网络权重以最小化训练损失,将损失函数降低至最低点;进行分类预测时,将多模态数据输入至训练完成的网络,得到检测物体的预测结果,通过可视化展示物体具有的属性及决策树推理规则及路由信息,以对预测结果进行很好地解释。
📄 202211206014X
📂 G06V10_764
👤 华东交通大学
📅 2022-09-30
本发明公开一种基于分层特征聚合的图像‑文本匹配方法及系统,包括:对图像和文本经预处理后得到图像场景图和文本场景图;对图像场景图和文本场景图分别进行分层特征聚合,得到每个对象的属性及对象间的关系,以此重构得到图像模态的对象特征和文本模态的对象特征;将图像模态的对象特征和文本模态的对象特征进行多模态特征融合,将融合特征映射至公共空间,在公共空间中测量不同模态间的距离,根据距离进行图像和文本的匹配。分层聚合每个对象节点上的属性信息和对象间的关系信息,以保证对象语义的完整性,然后仅利用对象节点的特征进行特征融合,有效降低跨模态匹配的复杂性,提高算法的效率。
📄 2021116632196
📂 G06F16_903
👤 山东师范大学
📅 2021-12-30
本发明属于计算机视觉技术领域,提供了一种基于多模态的数据与关系增强的遮挡行人检索方法。步骤如下:首先获取待检索的行人图像,将行人图像输入到训练完毕的遮挡行人检索模型,提取图片的遮挡鲁棒性特征,然后遮挡行人检索模型借助图文模型CLIP来利用图片和文本的特征,在原基准模型的基础上,引入遮挡增强来扩充数据集规模,并对行人被遮挡的现象进行预测并作出特征过滤,通过加入关系增强模块来增强类间的关系,最后将得到的检索特征,与待检索库中的行人图像进行相似度比对,按照相似性得分由高到低的顺序对检索结果进行排序,计算准确率和首位命中率,因此本发明可以有效得应对遮挡场景。
📄 202410557844X
📂 G06F16_535
👤 齐鲁工业大学(山东省科学院),山东省人工智能研究院,天津理工大学,北京阿叟阿巴科技有限公司,山东中联视听信息科技股份有限公司
📅 2024-05-08
本发明涉及自然语言处理技术领域,特别涉及一种多模态命名实体识别方法、装置以及计算机设备,通过构建包括有实体感知、视觉区域感知以及三元组感知的特定多模态命名实体识别任务的任务组合对,作为多模态命名实体模型的训练数据,逐步引导多模态命名实体模型通过不同任务特性的任务指令来增强不同模态信息之间的交互,提高多模态命名实体模型命名识别的性能,从而更加准确、有效地进行多模态命名实体识别。
📄 2024107106443
📂 G06F40_295
👤 华南师范大学
📅 2024-06-04
本发明涉及自然语言处理技术领域,特别涉及一种多模态讽刺检测方法、装置、设备以及存储介质,基于图像、文本双模态数据,针对各模态内容分层次地进行全局特征提取以及文本特征增强,基于获得的文本全局特征表示、图像全局特征表示以及文本增强特征表示,采用跨模态交互的方式进行不一致性评估,获得不一致性分数,利用图像全局特征表示、文本增强特征表示以及不一致性分数进行协同识别,充分的利用模态间信息进行讽刺检测,提高讽刺检测的准确性。
📄 2024102957228
📂 G06F18_241
👤 华南师范大学
📅 2024-03-15
本发明涉及自然语言处理技术领域,特别涉及一种多模态命名实体识别方法,包括:获得文档数据以及预设的多模态命名实体识别模型,将所述句子输入至所述文本特征提取模块进行特征提取,获得所述句子对应的文本特征表示;将所述图像输入至所述视觉特征提取模块中进行特征提取,获得所述图像对应的视觉特征表示;将所述视觉特征表示输入至所述视觉注意力提取模块中进行注意力提取,获得注意力提取后的视觉特征表示;将所述文本特征表示以及注意力提取后的视觉特征表示输入至所述跨模态交互模块中进行特征交互,获得跨模态特征表示;将所述跨模态特征表示输入至所述命名实体识别模块中进行实体识别,获得所述文档数据的命名实体识别结果。
📄 2023107123069
📂 G06F40_295
👤 华南师范大学
📅 2023-06-16
本发明公开了一种基于多模态动态路由的短视频点击率预测方法。该方法分别从短视频的不同模态信息抽取用户的兴趣,然后再融合用户在多模态空间下抽取出的多兴趣,预测用户对目标短视频的点击率。本方法主要由四个部分组成:第一部分构建短视频图网络,并把短视频多模态特征分别输入图网络,更新短视频多模态特征表征;第二部分根据短视频多模态特征,采用胶囊网络生成用户在不同模态下的兴趣表征;第三部分融合不同模态下的兴趣表征,生成用户兴趣表征;第四部分根据用户的多兴趣向量表征,预测用户对目标短视频的点击率。
📄 2020112831622
📂 G06F16_735
👤 中国计量大学
📅 2020-11-17