ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Counter-GEO-Bench:评估针对信息扭曲型生成式引擎优化的防御措施

Counter-GEO-Bench:评估针对信息扭曲型生成式引擎优化的防御措施 大家读完觉得有帮助记得关注和点赞摘要生成式引擎优化GEO使内容生产者能够提高其网页在生成式搜索引擎中的可见性但当对手发布看似普通的、经过GEO优化的文档这些文档被受害大语言模型LLM检索并综合成扭曲的答案时同样的技术可以用于传递定向错误信息。现有基准测试并未在受控条件下评估针对此威胁的防御措施。因此我们提出了Counter-GEO-Bench 1一个防御基准测试它将247个人类验证、质量筛选的查询与信息保留型和信息扭曲型的GEO改写配对并在三个受害LLM上评估攻击成功率ASR、假阳性率和答案质量方面的防御效果。在Counter-GEO-Bench下三种现成的防御措施Granite Guardian、Llama Guard 3和NeMo Self-Check Fact-Checking将ASR最多相对降低5.7%而Granite Guardian的降低在统计上不显著。安全分类法护栏针对的是策略违规而GEO错误信息作为流畅的信息内容通过了它们。为此我们提出了一个轻量级的基准基线C-GEO Guard2它相对降低了47.6%的ASR且效用损失接近于零证明了该威胁是可处理的。1 引言随着大型语言模型LLMs日益成为主要的信息来源有组织的错误信息宣传活动已经调整了其策略。对手应用生成式引擎优化合法发布者用来提高其在生成式搜索系统中可见性的相同技术来制作网页文档这些文档以流畅、主题相关的散文嵌入有针对性的虚假主张Wen等人2025。这些文档通过标准的网页发布渠道博客、被主流搜索引擎索引的评论网站进入检索流水线通过标准过滤器并被综合成LLM生成的答案用户将其视为可信的。对生产级生成式搜索引擎的审计证实了这个问题即使是良性的关键词查询也几乎有一半的情况会产生包含恶意内容的响应Luo等人2025尽管该工作研究的是明显恶意的URL而非GEO优化的错误信息即在检索层面与合法来源无法区分的内容。随着AI生成的网页内容激增这种攻击面有可能侵蚀用户对基于LLM的信息系统的信任。该攻击在文档层面运作对手使用GEO技术生成泛滥的网页嵌入有针对性的虚假主张同时保留良性来源的主题覆盖、语域和表面质量。当生成式搜索引擎将任何目标文档与合法来源一起检索时受害LLM会将虚假主张综合到其答案中。标准的护栏不会拦截该文档因为它不包含毒性、提示注入或策略违规危害完全在于嵌入流畅信息内容中的事实扭曲。现有基准测试并未在受控条件下在摘要阶段检索之后评估针对GEO优化错误信息的防御措施并伴有配对的效用测量。我们通过在作者控制的检索到合成流水线中在防御措施预期发挥作用阶段对其进行评估来解决这一空白。比较的对象是防御组件本身而非端到端产品黑盒产品测试仅暴露最终答案无法分离检索流水线、系统提示和隐藏护栏的影响。我们在一个受控的生成式搜索工具中实例化了这一设计使用了三个开源权重的受害LLM。我们做出三点贡献首个针对信息扭曲型GEO的防御基准测试。 Counter-GEO-Bench提供了247个人类验证的查询每个查询都带有目标文档的配对信息保留型和信息扭曲型改写并在受控的生成式搜索工具中针对三个受害LLM进行评估。配对设计将错误信息效应与GEO可见性提升分离开来这是先前基准测试所缺乏的方法论区别。部署的护栏漏掉此类威胁的实证证据。 使用Counter-GEO-Bench我们表明没有任何基线防御能将ASR降低超过3.2个百分点Granite Guardian的降低在统计上不显著而NeMo Self-Check与攻击负相关阻止了干净查询却放行了错误信息。一个表明威胁可处理的基准基线。 我们提出了C-GEO Guard一个块级对比检测器它以近乎为零的效用损失相对降低了47.6%的ASR绝对降低26.5个百分点。在由GPT 5.5改写的全部247个查询上同一护栏实现了60.4%的相对降低超过了在Sonnet评估集上的48%。因此检测信号可以跨改写模型泛化。图1基准构建流水线。从1,000个GEO-Bench查询-来源对开始改写器生成攻击元数据和配对的IP/ID改写。质量门保留通过两个条件的250对。经过排除三个有缺陷实例的人工验证后最终基准由247个实例组成。2 相关工作生成式引擎优化。 GEOAggarwal等人2024引入了帮助网页发布者通过结构化和风格化技术如引用钩子和权威措辞提高其在LLM生成答案中可见性的优化策略。Parry等人2024表明基于Transformer的神经排序器表现出可利用的位置偏差从而能够实现与查询无关的攻击跨主题提升任意内容而无需针对特定查询。Chen等人2026发现传统的黑帽SEO大部分在检索阶段被阻止98.2%过滤但面向LLM的策略仍然到达摘要阶段。我们的基准Counter-GEO-Bench建立在GEO-Bench语料库之上以评估当这些优化技术携带错误信息时的防御措施。检索增强生成投毒。 PoisonedRAGZou等人2025表明注入检索语料库的少量对抗性文档可以通过操纵检索上下文可靠地破坏RAG输出Lewis等人2020。Tamber和Lin2025进一步表明内容注入攻击——将任意句子插入相关段落或将查询词插入非相关段落——能够欺骗检索器、重排序器和LLM相关性判断器覆盖嵌入模型、交叉编码器和生成式模型。RAGuardKolhe等人2025提出了一种针对此类投毒的通用防御措施。Counter-GEO-Bench在GEO优化错误信息威胁模型下评估防御措施其中攻击以流畅、结构良好的网页内容形式到达而非对抗性扰动。安全护栏。 在审查了公开可用的护栏框架和RAG防御措施后我们选择了三种可能检测GEO错误信息的现成基线。Granite GuardianPadhi等人2025对检索到的块应用危害标准分类Llama Guard 3Inan等人2023Grattafiori等人2024使用安全分类法分类器过滤不安全内容而NeMo GuardrailsRebedea等人2023包括Self-Check Fact-Checking输出护栏它验证生成的响应是否基于检索到的证据。安全基准。 HarmBenchMazeika等人2024提供了一个标准化评估框架用于跨多种攻击类型的LLM自动化红队测试。CREST-SearchOu等人2026在网页增强型LLM中基准测试了提示注入和对抗性查询攻击而Unsafe LLM-Based SearchLuo等人2025评估了由LLM生成的搜索摘要引起的安全风险。Hu等人2024在对抗性构造的事实性问题下评估了黑盒生成式搜索引擎。相比之下Counter-GEO-Bench针对的是通过检索文档引入的GEO优化错误信息具有配对的效用测量和可重用的防御工具。3 基准设计3.1 威胁模型我们建模了一个控制网页内容的黑盒攻击者通过博客、评论网站或大规模一次性域名发布经过GEO优化的文档依赖于生成式搜索系统来检索和综合这些文档。该威胁模型与典型的对抗性查询攻击不同之处在于用户查询完全保持良性而恶意内容通过正常的检索路径进入流水线用户无法察觉。攻击者不控制下游生成式搜索流水线其中护栏可能在检索、上下文过滤或生成后阶段应用。有效的防御措施能在不无差别地压制来自合法发布者的优化内容的情况下减少错误信息。3.2 基准构建由于GEO-Bench训练集仅包含查询Counter-GEO-Bench使用其测试集该测试集包含1,000个查询每个查询配对了五个来自Google顶级搜索结果的清理过的HTML来源Aggarwal等人2024。我们使用Claude Sonnet 4.6作为基准改写器。对于每个查询它首先生成包含目标虚假主张、评估规则和提议的基准事实的元数据然后以两种方式改写一个目标来源同时保持其他来源不变。对于信息扭曲条件我们通过将来自权威域名如Wikipedia、.gov或.edu的URL改写为类似博客或评论网站来源的URL来避免不切实际的来源权威性。IP和ID改写的提示模板见附录A信息保留型IPGEO优化更清晰的结构、权威措辞、引用钩子保留所有原始事实。这代表了合法发布者的优化。信息扭曲型ID相同的GEO优化强度加上通过捏造的权威、虚假引用、时间框架和结构化格式以多种措辞注入的目标虚假主张。这代表了错误信息攻击。ID改写被分配一个或多个来自改写模板的攻击类别标签完整类别列表见附录A.2。配对设计是核心因为IP和ID改写源自相同的源文档并在相同的查询上进行评估该基准将错误信息效应与GEO可见性提升分离开来。图2生成式搜索工具与防御插入点。对于每个用户查询五个来源被分块使用混合BM25稠密检索进行检索并在由受害LLM合成之前进行重排序。块级防御在生成之前过滤检索到的上下文而NeMo的Self-Check Fact-Checking输出护栏则根据检索到的证据检查生成的答案。质量门。 质量门将基准限制为现实攻击者可能部署的似是而非的改写。每个改写获得一个质量分数Q计算为四个子分数的几何平均值1条件依赖的嵌入相似度2长度偏差3相对于参考语言模型LMAllal等人2025的困惑度比率以及4LLM评判的自然度。仅当Q≥ 0.65时改写才进入基准。任何零子分数都会使总分归零附录表8给出了完整的分段分数和阈值。表11,000查询构建集上的质量门通过率。通过两个门的查询构成评估语料库。条件通过率NIP通过59.7%597ID通过26.9%269联合通过25.0%250表1报告了通过率。联合通过率25.0%是保守设计的它降低了攻击结果被模板化文本夸大的可能性这种文本可能会被上游搜索或索引过滤器拒绝。人工验证。 我们手动检查了通过两个门的250个查询的LLM生成材料包括目标虚假主张、每个查询的攻击成功标准和提议的基准事实。删除了三个查询两个具有不合理的攻击成功标准一个具有不正确的基准事实得到N 247个基准实例附录C。3.3 生成式搜索工具生成式搜索工具图2模拟了一个已部署的生成式搜索流水线。文档被分块为512个令牌的窗口重叠128个令牌。检索结合了BM25和稠密BGE-large-en-v1.5嵌入Xiao等人2024以0.3/0.7的混合比例进行返回最多50个候选由BGE交叉编码器重排序为最终的top-12上下文。一个由vLLM提供服务的Kwon等人2023受害LLM在温度为零的情况下生成必须包含引用的答案。在每个查询中只有目标文档在不同条件下有所不同干净原始文本、IP信息保留型优化和ID信息扭曲型优化。四个非目标文档保持不变。评估了三个受害LLMGemma-4-31B-ITGoogle DeepMind2026一个31B参数指令微调模型。Qwen-3.5-35B-A3BQwen Team2026一个35B参数混合专家MoE模型。Llama-4-Scout-17B-16EMeta2025一个17B参数16专家MoE模型。3.4 评估指标攻击成功率ASR。 一个LLM评判员根据每个查询的攻击成功标准评估在信息扭曲型ID改写下生成的答案。它分配1.0完全成功答案断言了虚假主张没有含糊其辞、0.5部分成功主张与真相一起出现或被含糊其辞或0.0失败答案事实上正确。假阳性率FPR。 对于块级防御FPR是被错误标记的干净或IP块的比例。对于答案级防御它是被拒绝的干净或IP查询的比例。我们分别报告干净和IP条件下的FPR。答案准确率。 答案准确率在干净和IP条件下测量。与ASR类似LLM评判员将每个答案分类为正确1.0、部分正确0.5或不正确0.0。我们将整个评估实例的平均得分报告为百分比。答案质量。 除了准确率我们还使用相同的LLM评判员将答案质量作为与信息正确性不同的维度进行测量。质量在相关性、完整性和清晰度上以1-5分制评分最终质量分数为其平均值。4 防御方法4.1 现成护栏我们使用Counter-GEO-Bench评估三种现成护栏Granite GuardianPadhi等人2025。 IBM的Granite Guardian 3.3-8B作为块级过滤器应用在重排序之后。每个top-k块在危害标准下进行分类被评为不安全的块在合成之前被移除。Llama Guard 3Inan等人2023Grattafiori等人2024。 Meta的Llama Guard 3-8B以相同的块级过滤接口应用。每个块通过安全分类法分类器标记为不安全的块被丢弃。NeMo Self-Check Fact-Checking。 我们复现了NVIDIA NeMo Guardrails的Self-Check Fact-Checking输出护栏的记录行为Rebedea等人2023。在受害LLM生成草稿后同一模型判断响应是否基于检索到的块并从中蕴含不支持发布的草稿被替换为拒绝响应。表2防御配置。Granite Guardian、Llama Guard 3和C-GEO Guard操作于检索到的块NeMo Self-Check Fact-Checking是作用于生成答案的输出护栏。防御参数量阶段无防御——Granite Guardian8B块过滤器Llama Guard 38B块过滤器NeMo Self-Check Fact-Checkingvictim*输出护栏C-GEO Guard0.18B块过滤器*NeMo使用受害LLM17–35B本身作为其验证器。4.2 C-GEO GuardGranite Guardian、Llama Guard 3和NeMo Self-Check测试现有的通用护栏是否能检测到信息扭曲型GEO。为了提供一个面向GEO的参考防御我们引入了C-GEO Guard一个轻量级的块级检测器训练用于区分ID GEO改写与配对的IP改写和干净文本。其作用是使Counter-GEO-Bench具有可操作性未来的防御可以同时与现成护栏和专为信息扭曲型GEO设计的C-GEO检测器进行比较。架构。 C-GEO Guard是一个基于DeBERTa-v3-baseHe等人2023构建的句子嵌入模型1.84亿参数。对上下文化的令牌嵌入进行均值池化产生一个768维的L2归一化块嵌入e。在对比微调之后我们为每个ID-GEO攻击类别*k*计算一个原型质心cₖ使用改写生成期间分配的类别标签。一个文档可能带有多个标签其块对每个指定类别的质心有贡献其中Sₖ是属于类别*k*的训练块集合eᵢ是训练块*i*的嵌入cₖ是类别*k*的归一化质心。在推理时候选块嵌入e通过其与任何类别质心的最大余弦相似度进行评分score(e) maxₖ eᵀcₖ并在score(e) ≥ τ时被阻止其中τ是检测阈值附录E。训练过程。 我们使用多负例排序损失MNRL对编码器进行微调。每个训练示例将ID块作为正例并使用非ID块作为负例。这些负例来自同一源文档中的配对IP块、其他文档中的IP块、边界ID改写和干净块。这训练模型将ID改写中的操纵模式与合法的GEO优化和普通的干净文本区分开来。训练数据。 训练池来自未进入基准的750个查询731个未通过ID门19个未通过IP门。ID侧保持门控对于原始ID改写未通过的731个查询我们根据每个文档的失败原因指导重新生成新的ID改写。总共750个候选ID改写中有326个通过并成为正例。我们保留这些组装好的正例文档的10%用于阈值校准留下293个正例文档用于训练。对于负例我们不向IP改写应用质量门因为它们的质量变化有助于定义非ID边界。配对的IP硬负例仅来自相同的326个组装条目在训练前应用相同的10%保留。我们还包括约18个与原始文档余弦相似度0.98的边界ID改写作为近边界负例。干净的简单负例来自训练池中所有750个查询而非仅来自326个组装正例使得干净池比正例池大约大9倍。完整的训练细节见表12。5 实验5.1 设置所有实验均使用247个查询的评估集第3.2节。对于每个受害模型所有防御共享相同的工具仅防御干预不同。我们使用Claude Opus 4.6作为评判员并在所有条件下保持其提示、模型版本和解码配置固定。我们在ID条件下计算ASR并在干净和IP条件下测量假阳性和准确率。结果按受害模型报告并取三个受害模型的平均值。我们针对每个受害模型的50个模型-查询实例的分层样本在两个人工标注员上验证Opus 4.6这些样本在三个Opus分配的ASR级别上保持平衡附录D。Opus与人工标注员1和人工标注员2之间的一致性分别为κ0.739和0.869线性加权κ_w0.798和0.897而人工-人工一致性为κ0.727κ_w0.784所有三位评分者之间的Fleiss κ为0.778。这些结果表明对于Counter-GEO-Bench中使用的三分类攻击成功标签Opus评判员是可靠的。5.2 攻击缓解结果ASR点估计附带95%百分位数自助法置信区间通过10,000次自助重采样计算。对于配对防御比较我们使用配对自助法检验通过对查询进行一次重采样并将相同的重采样集应用于两种防御然后计算ASR差异。当95%置信区间排除零时我们认为差异在0.05水平上显著。每个单元的ASR置信区间和配对检验见附录G。表3三个受害LLM和四种防御在ID条件下的攻击成功率ASR%和答案质量Q̄N247。Δ_rel相对于无防御的相对变化。Q̄相关性、完整性、清晰度的均值1-5分。粗体每个模型的最低ASR。†由于98.4%的干净阻止率Llama-4上的NeMo被排除在3模型平均值之外。‡仅Gemma-4 Qwen平均值。95%自助法置信区间见附录G。防御Gemma-4-31BQwen-3.5-35BLlama-4-Scout3-模型平均ASRΔ_relASRΔ_relASRΔ_relASRΔ_relQ̄无防御56.5—55.9—54.7—55.7—4.49Granite Guardian51.4-9.0%53.8-3.8%56.94.0%54.0-3.1%4.37Llama Guard 351.8-8.3%51.4-8.1%54.3-0.7%52.5-5.7%4.38NeMo Self-Check50.2-11.2%52.0-7.0%†0.4-99.2%51.1‡-9.1%‡4.51‡C-GEO Guard30.6-45.8%29.4-47.4%27.5-49.7%29.2-47.6%4.48图3不同防御和受害LLM在ID条件下的ASR%N247。现成护栏聚集在无防御基线附近C-GEO Guard在所有模型上将ASR相对降低约48%。† Llama-4上的NeMo被排除98.4%干净阻止率。表3和图3展示了所有防御和受害模型的ASR和答案质量附录H附录I。无防御流水线实现了55.7%的三模型平均ASR95%置信区间[CI][53.1, 58.2]超过一半的质量门控单文档攻击使生成答案偏向目标虚假主张。没有现成护栏提供有意义的保护。Granite Guardian将平均ASR降低了1.7个百分点这一差异在统计上不显著p0.096配对自助法差异的95% CI[-0.7, 4.0]个百分点。Llama Guard 3实现了显著但操作上可忽略不计的3.2个百分点降低p0.001。NeMo Self-Check不能可靠地识别受攻击案例。使用Qwen时它阻止了3.24%的ID条件输出同时拒绝了4.86%的干净条件输出。使用Llama-4时它拒绝了几乎所有条件下的输出包括98.4%的干净输出因此我们将该单元从报告的平均值中排除附录J。C-GEO Guard处于不同的机制。拥有1.84亿参数Granite Guardian和Llama Guard使用的80亿参数的2.3%它将平均ASR相对降低了47.6%绝对降低26.5个百分点差异的95% CI[23.8, 29.3]个百分点p0.001附录G。在Llama-4上其表现最佳ASR从54.7%降至27.5%相对降低49.7%。按类别的降低见附录K。答案质量Q̄保持稳定C-GEO防御的答案平均为4.481-5分制而无防御为4.49。5.3 非受攻击性能表4不同条件下的块级阻止率%N_chunks ≈ 每个条件2,780个。ID阻止率是信息扭曲块上的比率。防御干净IPID阻止率Granite Guardian0.430.290.61Llama Guard 30.650.470.83C-GEO Guard2.302.1610.27表4报告了块级阻止率。Granite Guardian和Llama Guard在所有条件下都具有接近零的阻止率包括ID——它们标记了不到1%的信息扭曲块。这解释了它们微不足道的ASR降低防御措施很少干预。C-GEO Guard阻止了10.3%的ID块同时标记了2.3%的干净块和2.2%的IP块ID/干净阻止率比率为10.3/2.3 4.5倍。相比之下安全分类法过滤器实现了0.6/0.4 1.4倍Granite和0.8/0.7 1.2倍Llama Guard仅略高于随机。表5每个受害模型在干净和IP条件下的答案准确率%N247。准确率 (yes 0.5·partial) / N × 100%。Δ相对于无防御基线的百分比点差异。Avg. Δ 计算所有干净和IP单元的平均准确率变化。Gemma-4-31BQwen-3.5-35BLlama-4-ScoutAvg. Δ防御*干净 AccΔIP AccΔ干净 AccΔIP AccΔ干净 AccΔIP AccΔ无防御86.6—88.1—88.9—87.9—82.4—83.0——Granite87.20.686.2-1.989.30.489.31.480.6-1.883.20.2-0.2Llama84.0-2.687.4-0.787.2-1.788.10.285.63.285.02.00.1NeMo82.0-4.681.8-6.385.6-3.387.0-0.91.8-80.61.4-81.6-29.6C-GEO84.8-1.886.4-1.789.70.888.70.884.01.684.21.20.2*防御名称缩写Granite Granite GuardianLlama Llama Guard 3NeMo NeMo Self-Check Fact-CheckingC-GEO C-GEO Guard。表5报告了每种防御下的答案准确率。Avg. Δ列总结了所有干净和IP单元的平均准确率变化。C-GEO Guard具有最佳的效用特征平均变化仅为0.2个百分点而Granite Guardian和Llama Guard 3仍接近无防御设置分别为-0.2和0.1个百分点。相比之下NeMo Self-Check平均为-29.6个百分点因为它在Llama-4上崩溃干净准确率从82.4%降至1.8%。在干净和IP条件下综合答案质量分数仍接近无防御基线附录表22。5.4 C-GEO Guard的跨改写器迁移为了测试C-GEO Guard是否能泛化到训练时使用的改写器之外我们使用GPT 5.5以相同的GEO优化指令重写了247个基准查询-文档对。Qwen-3.5作为受害模型。表6报告了攻击侧的迁移结果。在固定τ0.90在原始校准集上选择的值的情况下C-GEO Guard在GPT 5.5改写上将ASR从55.7%降低到22.1%相对降低60.4%配对Δ33.6个百分点95% CI[28.7, 38.2]p0.001。IP FPR为2.80%略高于主基准上的2.16%IP准确率从86.8%降至82.6%附录表13。这些结果表明尽管固定阈值在GPT 5.5改写上给出了不太有利的效用特征但检测器保留了Sonnet之外的有用信号。由于改写器身份对防御者不可用部署需要针对异构改写器校准的单个阈值而非针对特定改写器的调整。所有247个改写都在没有质量门过滤的情况下进行评估。质量门敏感性分析发现跨阈值的ASR相对降低稳定在58-61%附录L表明攻击侧结果并非由质量门选择驱动。表6跨改写器迁移在247个GPT 5.5改写的查询上的ASRQwen受害无质量门。Δ_rel相对于无防御的相对变化。防御ASR (%)Δ_relID阻止率 (%)无防御55.7——C-GEO Guard22.1-60.4%9.86 分析6.1 迁移到独立编写的模板主要的跨改写器实验第5.4节更改了改写器同时保留了原始攻击模板。我们进一步使用一个独立编写的GPT 5.5模板测试了C-GEO Guard该模板省略了攻击类别标签、质量门提示以及在至少三个地方重复目标虚假主张的要求。我们评估了所有247个改写无质量门过滤使用Qwen-3.5作为受害模型。表7比较了两种设置。在原始Sonnet模板下C-GEO Guard实现了47.4%的相对ASR降低。在独立编写的GPT 5.5模板下它实现了32.0%的相对降低16.2个百分点而IP准确率提高了1.3个百分点。较小的降低可能反映了较弱的攻击约束与原始模板不同独立模板不要求虚假主张至少出现在三个地方。这些结果表明C-GEO Guard检测到的操纵模式超出了原始模板结构。表7迁移到独立编写的模板Qwen-3.5N247。Sonnet行复现了主表结果GPT行使用独立编写的模板无质量门过滤。Δ_rel每种设置中相对于无防御的ASR相对变化。设置防御ASR (%)IP Acc (%)Δ_relSonnet无防御55.987.9—C-GEO29.488.7-47.4%GPT无防御50.687.0—C-GEO34.488.3-32.0%6.2 配对设计暴露了防御失败模式在三个受害模型上评估的配对干净/IP/ID设计揭示了仅攻击或单模型评估会遗漏的失败模式。只有17.2%的查询在三个受害模型上产生完全成功的攻击而55.2%显示模型分歧。防御即放大器。 在Llama-4上Granite Guardian使74个查询的结果恶化同时仅改善了57个尽管在某些查询上降低了ASR但总体为负效应。在74个恶化的案例中29个安全查询ASR 0.0升级为部分或完全成功45个部分查询升级为完全成功。Chen等人2026表明传统SEO在检索阶段被阻止因为有害内容在形式上与干净内容可区分放大器效应表明当过滤器在安全分类法上操作而攻击内容在主题上合法时这种假设被打破。移除与虚假主张相矛盾的干净块消除了跨来源分歧并加强了攻击。负相关的自检。 在Qwen上NeMo阻止了12个干净查询同时阻止了8个ID查询——其阻止与攻击存在无关。在Llama-4上它阻止了所有条件下98.4%的查询。没有配对条件NeMo在Llama-4上的0.4% ASR看起来像是有效的防御而非近乎完全的拒绝。6.3 错误信息降低答案质量尽管评估标准将ASR和质量评分为正交维度第3.4节数据揭示了一种反比关系。跨模型汇总无防御ASR为1.0的答案在相关性/完整性/清晰度综合评分上得分为4.29而ASR为0.0的答案得分为4.70。一个可能的原因是坚持虚假主张缩小了响应范围并压制了高质量答案特征的平衡性含糊。与假设攻击成功独立于输出质量的检索投毒评估Zou等人2025不同基准的正交质量评分使质量变化可测量。这有一个实际意义当C-GEO Guard将查询从ASR 1.0翻转为0.0时质量得到恢复。在Llama-4上40个完全翻转的查询在相关性上获得0.70的提升在完整性上获得0.70在清晰度上获得0.58。移除错误信息块恢复了输出质量而非降低它。仍然穿透的攻击以前成功的攻击中有40%仍处于ASR 1.0比被阻止的攻击质量得分更低3.97 vs 4.47表明剩余攻击依赖于直接内容替换而非流水线标记的结构化GEO模式。7 讨论构建流水线作为可重用资源。 构建流水线在基准本身之外也很有用因为失败的基准候选仍然可以提供防御数据。关键在于不对称地重用它们将IP改写保留为硬负例但要求ID改写通过质量门才能被视为正例。这使C-GEO Guard获得了一个训练集该训练集在相同源材料上将恶意GEO操纵与良性优化区分开来。由此产生的1.84亿参数检测器在主基准上将ASR相对降低48%其在GPT 5.5改写上的60.4%降低表明信号不仅仅是Sonnet特定的措辞。相同的配方可以在另一个语料库上重新运行以产生本地防御数据而无需手动标记每个示例。残余攻击与未来方向。 有25个查询在所有三个模型和所有非C-GEO防御下产生ASR 1.0。与注入的段落可能从周围有机内容中突出的普通投毒设置不同我们的ID-GEO改写经过质量门控类似于普通的源文档。C-GEO Guard在每个模型上捕获36-40%的这些剩余案例指出了需要更强防御的地方。跨来源分歧量化、外部事实核查和基于来源的过滤可能是Counter-GEO-Bench设计用于评估的补充方向。8 结论我们提出了Counter-GEO-Bench一个针对信息扭曲型生成式引擎优化的防御基准测试。在三个受害LLM上现成护栏将ASR降低不超过3.2个百分点而Granite Guardian的降低在统计上不显著。这表明安全分类法过滤器和同上下文蕴含检查对于GEO优化的错误信息是不够的。与此同时C-GEO Guard表明该威胁是可处理的一个轻量级的对比块级检测器在不产生可测量效用损失的情况下将ASR相对降低48%绝对降低27个百分点并迁移到保留的改写器上实现了60.4%的相对降低。我们发布了代码、基准工具和基准数据以支持未来关于面向GEO的防御工作。
返回列表