Trigger-free and data-free backdoor attacks on deep neural networks

Jiahao Wang, Xianglong Zhang, Huanle Zhang, Xiaobo Ma, Xiuzhen Cheng, Pengfei Hu, Guoming Zhang · Scientia Sinica Informationis · 2025

近年来,随着深度神经网络广泛部署于众多关键领域,关于深度神经网络的后门攻击逐渐成为亟待关注的安全隐患。然而,多数后门攻击普遍假设攻击者能够获取目标模型的原始训练数据作为辅助数据集,这显著限制了攻击方法在现实场景中的实用性。此外,依赖显式触发器以激活后门的设计亦削弱了后门的隐蔽性。为此,本文提出一种无需训练数据与触发器的后门攻击方法,以提升后门攻击的实用性与隐蔽性。所提出方法基于一种新颖的微调框架,其将恶意数据的语义融入攻击者指定类别的特征表示中,从而实现无触发器恶意样本被稳定误分类至攻击目标类。同时,为保持模型在正常样本上的原始性能,本文引入知识蒸馏机制以替代传统训练数据,并结合弹性权重约束设计参数重要性评估机制,引导模型在保留原有知识的同时实现有效注入。我们在三个具有代表性的真实数据集上对所提方法进行了系统实证研究,实验结果验证了该攻击的有效性、隐蔽性与实用性。此外,本文还进一步探索了辅助数据集与模型反演技术在提升攻击能力方面的潜力。

Read the paper · More papers on PaperTik