本发明公开了一种基于外部三元组和抽象关系的图像描述生成方法。本发明首先提取图像描述文本中的三元组,构建外部关系库并对三元组进行特征编码。将文本相似度高于阈值的三元组聚类为一类。同时模型对图像进行目标检测得得到目标视觉特征集合与目标类别集合;根据文本相似度在外部关系库中查询目标与目标类别相似的三元组。模型利用目标视觉特征对图像的目标、属性、关系分别进行预测,生成场景图;并利用卷积神经网络融合视觉特征与文本特征,对目标、属性、关系进行特征编码。最后融合场景图目标、属性、关系编码特征与相似关系和抽象关系的编码特征,输入到双层LSTM序列生成模型中得到最终的图像描述。本发明使模型生成描述的表述更加丰富。
📄 2021116380655
📂 G06V10_762
👤 杭州电子科技大学
📅 2021-12-29
本发明属于图像数据处理领域,具体涉及一种基于自监督模态优化的图像描述生成方法;该方法包括:采用图像编码器提取图像的全局特征和网格特征,采用文本编码器提取文本描述的文本特征;采用视觉精炼模块对网格特征进行处理,得到精炼图像网格特征;将图像全局特征和文本特征输入到跨模态特征优化器中进行处理,得到优化图像全局特征;采用解码器对优化图像全局特征和精炼图像网格特征进行处理,生成文本描述;计算模型总损失并根据模型总损失调整模型参数,得到训练好的自监督模态优化图像描述模型;将待描述的图像输入到训练好的自监督模态优化图像描述模型,生成图像的文字描述;本发明可生成更自然、更准确的描述。
📄 2023109496355
📂 G06V10_77
👤 重庆邮电大学
📅 2023-07-31