IconFormer: an icon generation model based on CNNs and Transformer
Donghui Hou, Leqing Zhu · Journal of Image and Graphics · 2025
目的图标自动生成可以提高软件图形用户界面设计的效率,现有的图标自动生成方法存在多样性不足、生成过程复杂以及输入要求较高等问题,限制了生成结果的自由度和创新性。本文提出一种基于Transformer的高效且灵活的图标生成方法,该方法只需提供任意一对内容图标和风格图标,即可生成一幅新的具有特定风格的图标图像。方法提出一个图标生成模型IconFormer,网络结构中包括一个VGG(Visual Geometry Group)特征编码器、一个基于卷积神经网络(convolutional neural network,CNN)的风格编码器、一个Transformer多层解码器和一个CNN解码器,并用内容损失、风格损失、一致性损失和梯度损失组成的综合损失来优化网络模型。结果为了评估所提出的图标生成模型,构建了包含43 741个图标样本的数据集,在该数据集上对IconFormer模型进行训练和评估,并在相同条件下与先进的相关方法进行对比和分析。评估结果表明,本文的IconFormer生成的图标在颜色和结构上更为完整,而其他相关方法则一定程度出现了内容缺失、风格化不足和背景着色的情况,IconFormer在内容差异和梯度分数等量化指标上也明显优于其他模型。消融实验进一步表明了本文所构建的IconFormer模型各个创新点对图标生成过程所起的正向作用。结论所提出的图标生成模型IconFormer,结合了卷积神经网络和Transformer模型的优点,可以快速高效地生成具有不同风格的高质量图标。