ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

[论文学习]大语言模型中的水印窃取

[论文学习]大语言模型中的水印窃取 Watermark Stealing in Large Language Models论文重点本文由ETH Zurich SRI Lab的Nikola Jovanović、Robin Staab和Martin Vechev撰写发表于ICML 2024。论文首次系统地提出了水印窃取Watermark Stealing, WS这一概念证明攻击者仅需通过黑盒API访问水印LLM花费不到50美元即可逆向工程出近似的水印规则。窃取后的水印模型可同时用于伪造攻击Spoofing和清洗攻击Scrubbing成功率均超过80%彻底颠覆了此前学界认为当前水印方案已可部署的主流观点。核心研究内容问题定义大语言模型水印被广泛认为是检测AI生成内容、追溯文本来源的有效手段。OpenAI、Meta、Alphabet等科技巨头已承诺部署水印技术美国行政命令和欧盟AI法案也将其纳入标准化要求。然而本文作者指出当前水印方案对抗击恶意攻击者的鲁棒性仍被严重高估。核心问题在于如果一个攻击者能够通过反复查询水印模型的API来逆向工程出隐藏的水印规则即“水印窃取”那么水印的价值就会被彻底瓦解。此前虽有研究提及类似威胁但无人系统性地提出自动化窃取算法也无人注意到窃取还能显著提升清洗攻击的效果。创新方法论文的核心创新在于提出了首个自动化的水印窃取算法并系统性地将其应用于两类下游攻击一水印窃取Step 1攻击者通过API向受害者模型 (LM_{mo}) 发送一组精心设计的提示词利用返回的响应构建一个近似模型以估计水印的隐藏分区规则。窃取的最终产物是一个评分函数 (s^*(T, [T_1 T_2 \dots T_h]))表示攻击者对于“在特定上下文 (h)-gram 后候选词 (T) 属于绿色列表green list”的置信度。二下游攻击Step 2有了 (s^*) 之后攻击者可以将其与一个开源的辅助模型 (LM_{att}) 结合无需额外查询受害者模型即可发动攻击伪造攻击Spoofing在生成过程中根据 (s^) 对候选词进行偏置——高评分即更可能为绿色的词获得logit加成。公式为[l’T l_T \delta{\text{att}} \cdot s^(T, [T_1 T_2 \dots T_h])]这使得攻击者能够生成任意主题的高质量文本并被检测器误判为来自受害者模型。清洗攻击Scrubbing利用 (s^*) 的知识攻击者可以在保留语义的前提下将水印文本改写为非水印版本。此前学界认为在长文本上清洗攻击难以奏效但窃取水印后的攻击者将成功率从接近0%提升到超过80%。研究成果论文在多个最先进的水印方案上进行了全面评估包括KGW-SOFT、KGW-HARD、KGW2-SUM、KGW2-SELFHASH和UNIGRAM等。核心实验结果如下成本极低在ChatGPT定价模型下一次性的窃取成本低于50美元。伪造攻击成功率超过80%针对此前被认为“安全”的KGW2-SELFHASH方案攻击者在最严格的威胁模型设定下无检测器API访问、无水印前基线响应实现了超过80%的伪造成功率。清洗攻击显著提升在长文本的困难设定下攻击者将流行释义器的清洗成功率从接近0%提升到超过80%而所有基线方法均无法达到25%。推翻“权衡”假说此前研究认为水印方案可以在伪造鲁棒性和清洗鲁棒性之间进行权衡。本文证明一旦水印可被窃取两类攻击均可同时以高水平实现。实际落地应用的可能性对模型提供方的警示价值本文的核心贡献不在于提供攻击工具而在于揭示当前水印方案的根本性漏洞。任何计划部署LLM水印的组织都应将“水印窃取”作为首要威胁纳入安全评估。对防御研究的推动论文公开了全部代码和示例https://watermark-stealing.org为后续更鲁棒的水印方案研究提供了基准攻击模型。局限性论文作者坦言目前尚未知悉任何已实际部署的LLM水印系统因此其揭示的攻击路径尚无法被恶意利用。但这也意味着——现在是加固水印方案的最佳窗口期。技术细节水印方案背景论文聚焦于目前最主流的分布修改型distribution-modifying水印。以KGW方案为例在每个生成步骤用一个伪随机函数PRF(f) 将词汇表 (V) 划分为 (\gamma|V|) 个“绿色”词和其余“红色”词PRF的种子由前一个或前 (h) 个token的哈希值与秘密密钥 (\xi) 共同决定生成时倾向于选择绿色词KGW-SOFT通过logit加成 (\delta)KGW-HARD则直接禁用红色词检测时统计文本中绿色词的数量 (n_{\text{green}})计算z统计量[z \frac{n_{\text{green}} - \gamma L}{\sqrt{L\gamma(1-\gamma)}}]其中 (L) 为文本长度。若p值低于预设阈值则判定为水印文本。KGW2-SELFHASH是Kirchenbauer等人2024推荐的最有前景的变体其PRF种子计算方式为[\min{H(T_{t-h}), \dots, H(T_{t-1}), H(T_t)} \cdot \xi \cdot H(T_t)]窃取算法的核心思路攻击者的核心任务是从API响应中推断出绿色/红色分区的规律。由于不知道秘密密钥 (\xi)攻击者无法直接计算绿色列表但可以通过统计方法估计每个token在给定上下文下成为绿色词的概率——这正是评分函数 (s^*) 的含义。具体而言攻击者收集大量受害者模型的响应文本后对每个 ((h1))-gram 出现频率进行统计分析在相同上下文下出现频率显著偏高的token更可能是绿色词。窃取完成后攻击者将 (s^*) 嵌入到辅助模型的解码过程中通过logit偏置来模仿水印行为。威胁模型设定论文定义了四个威胁模型维度维度设定说明检测器访问D0无访问检测器完全私有攻击者无法验证攻击效果D1API访问攻击者可查询检测器获得二值反馈基线响应B0不可用无水印前的基线响应攻击者仅能访问水印APIB1可用攻击者可获取水印部署前的响应语料库论文在实验部分聚焦于最严格的D0, B0设定即攻击者既无法访问检测器也无法获得无水印基线响应。研究设定硬件与软件配置模型规模实验覆盖了从1.3B到30B参数的开源模型包括多种instruction-tuned变体API成本估算基于2024年1月的ChatGPT定价模型攻击预算低于50美元的一次性查询成本开源实现全部代码已在GitHub上开源eth-sri/watermark-stealing实验设计要点多样化的提示词攻击者在不同主题的提示词上评估比输出“任意文本”更具挑战性多密钥场景评估了受害者模型在每次响应中从 (k) 个密钥池中切换密钥的设定释义场景测试了攻击者对给定非水印文本进行释义的同时印入水印的能力有害内容生成验证了即使受害者模型经过对齐拒绝有害提示攻击者仍可利用辅助模型生成被检测为水印的有害文本综合分析学术意义这篇论文在LLM水印安全领域具有里程碑意义。它不仅首次系统化地定义了“水印窃取”这一威胁模型更重要的是将此前分散的伪造攻击和清洗攻击统一到了一个共同的威胁框架下。此前研究者将这两类攻击视为独立问题本文证明它们本质上是同一枚硬币的两面——一旦水印规则被部分逆向两类攻击均可被赋能。论文的另一重要贡献在于对“权衡假说”的挑战。Kirchenbauer等人2024认为水印方案可以在伪造鲁棒性和清洗鲁棒性之间做取舍。本文的实证结果证明在存在水印窃取的威胁下这种“权衡”不复存在——攻击者可以同时获得高水平的伪造和清洗能力。实践启示对于正在或计划部署LLM水印的组织本文提出了一个冷峻的现实仅靠水印算法的“秘密性”来保障安全是不够的。Kerckhoffs原则在密码学中已是公理——系统的安全不应依赖于算法的保密而应依赖于密钥的保密。然而本文证明即使密钥保密攻击者仍可通过统计推断部分恢复水印规则。这意味着未来的水印方案设计需要从根本上重新思考如何在即使攻击者能够近似推断绿色列表的情况下仍能保证水印的可靠性可能的思路包括动态密钥更新、多密钥水印、以及更复杂的依赖结构等。局限性与后续研究本文作者对自身工作的局限性有清醒认识。同时论文在以下方面为后续研究留下了空间检测器侧防御如何设计能够识别伪造尝试的检测器多密钥水印通过增加密钥数量提高窃取难度自适应窃取针对动态变化的生成策略实践应用对模型提供方的建议将水印窃取纳入红队测试任何水印方案在上线前都应模拟本文的攻击方法进行压力测试限制API查询频率和总量本文攻击的成功依赖于大量API查询成本50美元限制查询可提高攻击门槛考虑动态密钥策略定期轮换水印密钥增加攻击者逆向工程的难度监控异常查询模式大量重复或结构相似的提示词可能是水印窃取的前兆对研究者的建议将水印窃取作为基准攻击任何新提出的水印方案都应评估其对本文攻击方法的鲁棒性探索抗窃取的水印设计如何设计即使部分规则被泄露仍能保持安全性的水印机制检测伪造尝试开发能够区分真实水印和伪造水印的检测方法代码与资源论文官方项目网站https://watermark-stealing.org代码仓库https://github.com/eth-sri/watermark-stealing论文PDFhttps://files.sri.inf.ethz.ch/website/papers/jovanovic2024watermarkstealing.pdf复制实现https://github.com/juanbelieni/watermark-stealing-replication参考资料来源原始论文: Jovanović, N., Staab, R., Vechev, M. (2024). Watermark Stealing in Large Language Models.Proceedings of the 41st International Conference on Machine Learning, PMLR 235:22570-22593.arXiv预印本: https://arxiv.org/abs/2402.19361项目官网: https://watermark-stealing.org/ICML 2024 Poster: https://icml.cc/virtual/2024/poster/33848
返回列表