InSty: a robust multi-level cross-granularity fingerprint embedding algorithm for multi-turn dialogue in large language models
Zhenhua Xu, Meng HAN, X. Yue, Wenpeng Xing · Scientia Sinica Informationis · 2025
随着大语言模型(large language model, LLM)的广泛应用, 其知识产权(intellectual property, IP)保护问题日益凸显, 特别是在应对模型盗窃和许可违规等威胁时. 现有的模型指纹技术虽取得一定进展,但大多依赖于白盒访问权限,而基于后门攻击嵌入指纹的算法大多仅适用于单轮对话场景.即便在多轮对话场景中,现有方法通常局限于同一层次触发器(如词级触发器)的简单组合,未能充分挖掘多轮对话的语义空间与多层次触发器的潜力.针对这一局限, 本文提出了一种基于多轮对话场景的多层次跨粒度触发器设计的模型指纹嵌入方法(InSty). InSty通过结合词级触发器与句级触发器, 并将其分布于多轮对话的不同轮次, 使指纹触发依赖于跨轮次的特定上下文条件组合, 从而显著提升了指纹的隐蔽性和鲁棒性. 大量实验表明, InSty在黑盒场景下的触发率超过 94\%, 对模型性能影响较小部分模型的性能甚至有所提升(LLaMa2-7B-Chat 提升近 7\%), 并能有效抵御模型融合、裁剪、输入扰动等多种攻击操作. 本文的研究充分利用了多轮对话的语义空间和多层次触发器设计, 为大语言模型的知识产权保护提供了全新思路和技术支撑.