TAEFuzz:用“可迁移对抗样本”自动攻击深度学习模型 “ 随着深度学习模型在图像识别等任务中的广泛应用其安全性问题日益受到关注。研究表明深度学习模型容易受到对抗样本攻击微小扰动即可导致模型输出错误结果攻击往往具有跨模型迁移能力。然而仍存在关键挑战如何自动生成高质量攻击样本如何系统性测试模型的鲁棒性如何提升测试效率与覆盖能力传统 fuzzing 方法难以直接应用于深度学习系统因为其输入空间是高维连续空间如图像。为此论文提出TAEFuzz一种基于可迁移对抗样本的自动化深度学习模糊测试框架。 ”论文标题TAEFuzz: Automatic Fuzzing for Image-based Deep Learning Systems via Transferable Adversarial Examples发表时间ACM Transactions on Soware Engineering and Methodology2025作者单位河海大学、皇家墨尔本理工大学、中山大学、柏林洪堡大学 开源代码https://anonymous.4open.science/r/TAEFuzz-457501—方法介绍图1是可转移的对抗示例生成。攻击者在代理模型上生成具有迁移性的对抗样本并将其输入到目标模型中进行攻击。测试人员则模拟恶意攻击者的攻击方式在代理模型上生成测试用例。这些测试用例被输入到目标模型中用于发现具有迁移性的错误。图 1. 可转移对抗示例生成TAEFuzz 的核心思想是利用对抗样本的“迁移性”生成能够跨模型触发错误的测试输入从而实现高效 fuzzing。整体流程可以概括为三步① 对抗样本生成基于源模型生成具有攻击性的输入样本② 可迁移性增强优化样本使其在不同模型间保持攻击效果③ 模型测试将样本输入目标模型检测错误行为。图 2. TAEFuzz概述图小结将“对抗攻击”转化为“模糊测试输入生成策略”。02—关键机制对抗样本驱动 Fuzzing将 adversarial attack 融入模糊测试框架。迁移性增强机制提升样本在不同模型之间的攻击能力。连续空间测试策略突破传统 fuzzing 在离散输入上的限制。高效测试流程减少无效样本提高漏洞发现效率。模块设计思路作用对抗样本生成利用梯度信息生成扰动图像构造初始攻击输入迁移性优化增强样本跨模型攻击能力提升 fuzzing 泛化性种子选择策略选择高潜力样本进行扩展提高测试效率反馈机制基于模型输出变化进行引导优化样本生成过程错误检测检测分类错误或异常输出发现模型缺陷小结TAEFuzz 将“攻击生成 模型反馈”结合实现闭环测试。03—实验结果实验是在ImageNet和Tiny-ImageNet数据集上进行的。对于非目标攻击我们从ImageNet验证集中随机选择了1000张图像从Tiny ImageNet验证集随机选择了2000张图像作为原始良性示例。主要实验结果如下。TAEFuzz采用RMI用于提高发现的可转移错误的数量实验结果见表1-4。实验分为两部分分别针对基于传输的目标攻击和基于传输的非目标攻击。对于非目标攻击从以下设置中验证RMIS1在单个代理模型上没有与其他方法的耦合。S2在单个替代模型上与CT存在耦合。S3在集合替代模型上与CT存在耦合。结果表明RMI在所有模型上都显示了最佳结果特别是在鲁棒模型上。与现有的最佳方法DT-PI相比CT-RP在鲁棒模型上将ASR提高了56.2%-71.2%。表1. 不同方法与其他方法顶表不耦合与CT底表耦合在ImageNet数据集上使用单个模型查找可传递错误的能力表2. 与CT不耦合的不同方法在微小ImageNet数据集上使用单个模型查找可传递错误的能力表3. 不同方法与CT结合在ImageNet数据集上使用集成模型查找可传递错误的能力表4. 使用集成模型查找目标误差的不同方法的能力小结TAEFuzz是一种通过可转移对抗示例进行基于图像分类的DNN的新模糊方法。TAEFuzz可以在目标模型中发现更多可转移的误差并提高生成示例的图像质量。此外TAEFuzz为噪声模块提供了一种成本较低的训练方法显著提高了目标模型的稳健性。 总结TAEFuzz的核心贡献在于将对抗样本生成与模糊测试融合提出一种面向深度学习系统的自动化测试框架。该方法证明对抗攻击不仅是威胁也可以作为高效测试工具。未来研究可能进一步探索多模态深度学习系统的 fuzzing、更强泛化能力的对抗样本生成方法。 欢迎留言讨论你认为对抗样本是否会成为 AI 系统测试的核心工具Fuzzing 与对抗攻击的结合是否会成为主流方向 点赞 收藏 分享你的支持是我们持续解析高水平软件安全论文的最大动力