本发明公开了一种注意力相似度迁移的跨模态哈希检索方法,包括:特征提取多模态数据,得到文本特征向量和图像特征图;将图像特征图利用混合自注意力机制分配自注意力权重,利用多头注意力机制对文本特征向量分配自注意力权重,根据自注意力权重大小分别强化关注图像和文本的关键特征;将图像和文本的关键特征进行多模态共同注意力机制处理,将多模态数据特征映射至公共实值空间;计算公共实值空间的特征相似度,利用迁移学习和哈希函数,将相似关系从公共实值空间迁移至哈希空间,训练得到哈希码;根据哈希码计算相似度,并进行排序。本发明能够强化关注图像和文本的关键信息,提升特征提取质量,加强了模态间的信息交互,同时降低了训练难度。
📄 2022108829101
📂 G06F16_31
👤 北方民族大学
📅 2022-07-26
本申请公开了基于概念向量学习的动态跨模态哈希检索方法和系统,方法包括:基于当前标签信息和哈达玛矩阵构建概念向量矩阵;概念向量矩阵中的概念向量用于表征相同标签的样本具有相同且不变的向量;基于当前标签信息和历史标签信息构建数据相似度矩阵;基于概念向量矩阵和数据相似度矩阵得到目标哈希码;基于目标哈希码得到目标哈希函数;根据目标哈希函数对待查询数据进行分析得到待查询数据对应的待查询哈希码;将待查询哈希码与数据库中的目标哈希码进行相似度计算,得到目标检索结果。本申请能够克服动态数据环境下概念漂移问题的缺陷,提升跨模态哈希模型对概念漂移的适应能力,提高动态跨模态哈希检索性能,可广泛应用于信息处理技术领域。
📄 2024114534864
📂 G06F16_903
👤 华南师范大学
📅 2024-10-17
本申请公开了基于半配对数据的动态跨模态哈希检索方法和系统,方法包括:基于配对标签信息对当前配对哈希编码进行学习得到目标配对哈希编码;基于配对数据集和非配对数据集之间的模态内相似性矩阵以及非配对数据集的模态间相似性矩阵对当前非配对哈希编码进行学习得到目标非配对哈希编码;基于目标配对哈希编码和目标非配对哈希编码得到总目标哈希编码;基于总目标哈希编码和多模态数据特征向量对多模态数据集的当前多模态哈希函数进行学习得到目标多模态哈希函数;基于数据库的目标多模态哈希函数和总目标哈希编码对待检索样本进行检索,得到目标检索结果。本申请能够提高跨模态哈希检索的准确性和效率,可广泛应用于信息处理技术领域。
📄 2024110921285
📂 G06F16_41
👤 华南师范大学
📅 2024-08-09
一种面向生活记录的跨模态图像检索方法,包括训练网络构建、数据集处理、训练与检索和检索结果输出四个过程。本发明保证了其数据集的可靠、有效、实用,同时利用预训练网络的微调训练出检索模型,并通过检索模型寻找与问询最接近的生活记录图片。在数据集中含有大量图片之外其他模态数据的情况下,在训练模型的过程中,通过对训练集施加的范围限制,有效利用了心跳、步数等生物信息提高训练的性能:判别模型能够找出最符合问询类型的10张图片,并保证这10张图片彼此之间具有一定的差异性,即在确保准确率的前提下,同时尽力提高检索结果的多样性,使得检索结果的查准率和查全率均得到保障。
📄 2019109493079
📂 G06F16_535
👤 浙江工业大学
📅 2019-10-08
一种基于跨模态对齐的多粒度手语视频‑文本检索方法,首先通过自监督方法增强手语视频表征;再通过时间注意力同时考虑视频片段间和视频片段内信息的相关性优化视频片段特征,利用时间协方差池化将视频片段特征聚合为手语视频粗粒度特征,联合细粒度信息充分挖掘手语视频和文本间的跨模态多粒度对齐信息;接着利用共享注意力残差高斯分布网络将手语视频和文本参数化为特征分布,通过对齐特征分布缓解手语视频与文本的模态差距;最后通过计算文本到手语视频的细粒度相似度分数,来检索与查询文本相匹配的手语视频。本发明考虑了手语视频‑文本检索问题的多粒度跨模态信息,检索结果准确性高,效果好。
📄 2025100094933
📂 G06F16_732
👤 浙江工业大学
📅 2025-01-03
一种基于边界互信息的跨模态哈希检索方法,包括以下步骤:步骤1、搭建网络,构建特征学习网路和哈希学习网络,每个模态的特征学习网络和哈希学习网络均由多层全连接层组成的生成对抗网络构成;步骤2、构建哈希函数;步骤3、构建由交叉熵损失,排序余弦三元损失、边界互信息损失、带正交约束的离散损失构成的目标函数;步骤4、目标函数优化;步骤5、将数据集划分为查询集Q与待查集P,并取待查集P的一部分作为训练集T,将训练集数据和标签信息作为网络的输入,并初始化网络参数和哈希码,重复步骤4,迭代得到最优的网络参数和哈希码,根据步骤2获得最优的哈希函数;步骤6、跨模态检索与精度测试。本发明优化收敛,检索精度高。
📄 202311690560X
📂 G06F16_31
👤 浙江工业大学
📅 2023-12-11
本发明公开了一种基于文本生成和迭代匹配的图文检索方法,包括利用BI‑GRU网络模型和CNN网络模型依次提取出初始文本特征向量和初始图像特征向量。本基于文本生成和迭代匹配的图文检索方法通过分别训练BI‑GRU网络模型和CNN网络模型,利用训练好的BI‑GRU网络模型和CNN网络模型分别提取文本特征和图像特征,再分别与数据库中的图像特征和文本特征计算相似度,将数据库中相似度最大的前若干名的图像特征和文本特征作为检索的结果输出,实现图文检索;文本生成模块通过图文信息交互增强了图像和文本的整体语义相关性,有效解决跨模态图文检索中难以直接度量图像和文本的相似性的问题,提升图文检索精度。
📄 202310781908X
📂 G06F16_432
👤 浙江工业大学
📅 2023-06-29
本发明提出了一种基于判别性关联最大化哈希的跨模态检索方法,包括:对训练数据集进行多模态提取,得到训练多模态数据集;对于训练多模态数据集,构造该数据集上的基于判别性关联最大化哈希的目标函数;求解所述目标函数,得到图像、文本的投影到公用的海明空间的投影矩阵、图像文本对的联合哈希码;对于测试数据集,投影到所述公用的海明空间,并通过哈希函数量化为训练集样本的哈希码;基于哈希码进行跨模态检索。本发明提高了跨媒体检索的效率和准确度。
📄 2017105810831
📂 G06F17_30
👤 山东师范大学
📅 2017-07-17
本发明公开了一种基于协同矩阵分解的跨模态检索方法,同时考虑保持原始空间样本对的局部几何流形结构,使用图正则项加入了模态内与模态间的约束,采用普遍使用的mAP(平均准确率)作为性能评价指标。本发明不仅考虑了样本的模态内相似性,还考虑了样本对模态间的相似性,为以文检图和以图检文准确性提供了保障。本发明利用协同矩阵分解技术、哈希函数,同时加入了保持模态内与模态间相似性的图正则化项,提高了以文检图和以图检文的相互检索性能,广泛应用于移动设备、互联网以及电子商务中的图片文本互相检索服务。
📄 2018100624840
📂 G06F16_583
👤 南京邮电大学
📅 2018-01-23
本发明属于跨模态检索、模式识别技术领域,公开了一种基于鲁棒监督的深度离散哈希跨模态检索方法及系统,基于鲁棒监督的深度离散哈希跨模态检索方法采用模态内和模态间一致性保持策略,同时进行非冗余特征选择;并选择具有最小冗余度的鲁棒性和鉴别性特征生成二进制哈希码;再基于奇异值分解进行离散哈希学习。本发明的RSDDH方法可以优于几种最先进的浅层跨模态哈希方法,且随着哈希码长度的增加,本发明所提出的方法的性能就越好。根据实验结果,验证了特征选择策略、离散哈希方案,模态间和模态内一致性保持策略的有效性,提高了跨模态哈希检索的性能。
📄 2019102469914
📂 G06F16_432
👤 广东石油化工学院
📅 2019-03-29
本发明针对大规模数据的跨模态检索提出了一种基于继承映射的跨模态迁移哈希检索方法。首先,通过线性跨模态迁移学习来保持原始异构特征之间的关联关系;同时,继承映射与跨模态迁移相互协作,以确保从原始特征空间到哈希空间的相关性继承。进一步地,为了挖掘原始特征的结构近邻关系,本发明也采用了具有线性复杂度的锚图模型。而且,高层语义信息也通过线性回归的方法被加强。最终,一种高效的迭代优化策略被用来解决离散优化问题,这有效地避免了传统解法造成的松弛和量化误差。
📄 2019102852348
📂 G06F16_31
👤 山东师范大学
📅 2019-04-10
本发明提供了基于文本生成图像技术的文本视频检索优化方法,本发明利用Stable Diffusion文本生成图像模型,通过对数据集中的文本信息进行图像生成,将生成的图像信息作为视频帧加入训练集,从而有效扩充数据规模。本发明还将考虑将关键帧信息反向生成文本信息,进一步丰富文本数据集。基于扩充的数据集,本发明将设计新的损失函数,综合考虑视频的细粒度与粗粒度特征,优化文本视频检索模型的训练过程,提升检索效果。本发明通过Stable Diffusion驱动的数据增强及优化的损失函数设计,能够有效解决现有文本视频检索研究中的数据缺乏和模型训练不充分等问题,为多媒体内容分析和检索应用提供新的技术支撑。
📄 2024108021067
📂 G06F16_783
👤 南京信息工程大学
📅 2024-06-20