本发明涉及一种基于多模态信息的服装草图到图像生成方法,本发明利用多模态信息的协同特征表示,提出了一个用于服装草图到图像的多模态生成模型,该模型结合了CNN多尺度特征提取的优势与Transformer强大的掩码注意力机制,对于服装图像,提出一个分层编码模型,并引入特征匹配损失,使得生成的服装图像纹理更加清晰。同时,提出一个Dup l icate‑Transformer学习不同模态信息之间的关联,协同指导生成具有指定属性的服装图像。本发明的方法可以生成高度真实的服装图像,并且在属性控制方面具有更大的灵活性,多样性和保真度都得到了较为明显的提升。