一种基于深度学习的图像描述方法,包括将图像数据集分为训练集和测试集;构建图像描述模型;在ImageNet数据集上训练完成残差网络预训练模型,加载残差网络预训练模型参数至图像描述模型中的可变形卷积残差网络中;将训练集中的图像送入空间变换网络中,空间变换网络的输出结果送到可变形卷积残差网络,可变形卷积残差网络输出图像的特征向量;生成图像对应的文本序列;完成语言模型的构建生成图像对应的语句;使用AdamW优化算法对图像描述模型进行训练;输出图像对应的描述语句;本发明提取的图像特征具有更好的空间表达能力,生成的句子准确度高,语言结构丰富,并且模型训练时间少,收敛速度快。
📄 2018116461504
📂 G06V30_196
👤 陕西师范大学
📅 2018-12-30