
论文*GEO: Generative Engine Optimization*作者Pranjal Aggarwal, Vishvak Murahari, Tanmay Rajpurohit, Ashwin Kalyan, Karthik Narasimhan, Ameet Deshpande普林斯顿大学、IIT Delhi 等发表KDD 2024第 30 届 ACM SIGKDD 知识发现与数据挖掘会议链接arXiv:2311.09735 DOI: 10.1145/3637528.3671900 代码与数据https://generative-engines.com/GEO/一、研究动机生成式引擎里的第三方传统搜索引擎的利益结构里有三方用户、搜索引擎、内容创作者。搜索引擎返回链接列表用户点击访问创作者获得流量——这个循环支撑了过去二十多年的创作者经济。SEO搜索引擎优化这个行业能够存在正是因为这个结构里有一个明确、可度量的优化目标排名。生成式引擎Generative Engine, GE打破了这个结构。BingChat、Google SGE、Perplexity 这类系统不再返回链接列表而是检索多个来源后用大模型直接合成一段多模态答案。用户拿到了更快、更个性化的体验引擎提升了满意度但第三方——网站和内容创作者——被置于一个尴尬的处境自己的内容何时、以何种方式、在多大程度上出现在答案里完全是一个黑盒。没有名次可查没有规则可依甚至没有被引用时的通知机制。论文指出这个问题的严重性在于数以百万计的小型内容生产者依赖线上可见度生存而生成式引擎直接给答案的模式天然地削弱了用户访问来源网站的必要。如果创作者在这场范式迁移中持续受损长期看会反噬整个信息生态——引擎终究需要有人持续生产高质量内容。这篇论文的贡献就是把上述模糊焦虑形式化为一个可研究的问题作者提出 Generative Engine OptimizationGEO框架研究内容创作者在黑盒条件下能否仅通过调整内容本身提升其在生成式答案中的可见度并用大规模实验给出了量化答案。值得一提的是作者的立场——他们做这项研究的出发点是既然生成式引擎已不可逆就应该确保创作者经济不被它碾碎。这决定了论文的视角始终站在内容生产者一侧这也是它和大量教引擎怎么做得更好的 RAG 研究的根本区别。二、生成式引擎的工作机制论文将生成式引擎抽象为如下流程用户查询→ 查询理解与改写可能拆分为多个子查询→ 检索器从数据库如互联网召回相关文档集合→ 大模型基于召回文档生成答案→ 答案中附带对来源的引用标注供用户核验技术上这就是检索增强生成RAG架构。这一抽象对应到内容的命运是一个先被检索、再被阅读、后被引用的多阶段筛选漏斗检索阶段决定内容是否进入候选集。它依赖传统的索引与匹配技术但也受查询改写影响——一个用户问题可能被系统扩展成多个不同表述的子查询覆盖更多语义角度阅读阶段决定模型从候选文档中提取什么。大模型不是关键词匹配器它会通读文本并判断哪些段落值得采用这一阶段文本的结构、清晰度、信息密度开始起作用引用阶段决定答案最终标注哪些来源、用什么样的措辞转述它们。这个三段视角是理解后文所有实验结果的钥匙九种优化方法中有效的那些大多作用在第二、三阶段——即让内容更值得被模型阅读和转述而不是在传统意义上更容易被匹配。顺带一提这条链路也解释了为什么 GEO 的实验必须以整段改写为单位施加干预检索阶段的匹配信号主要由索引系统和查询改写决定内容创作者可施加的影响有限而阅读与引用阶段直接面对文本本身才是内容侧真正的可操作空间。论文把全部九种方法都设计为文本改写策略正是基于这个判断。三、核心设计如何度量可见度SEO 时代有排名这个天然指标生成式答案里没有名次。一段答案可能引用五个来源有的被转述了整段有的只在括号里挂了个链接有的出现在开头有的埋在结尾。论文因此自定义了一套可见度指标Impression Metrics这是全文方法论上最有价值的部分Word Count词数来源内容被答案采纳的词数衡量引用篇幅。直觉是被大段转述的来源比被一笔带过的来源更可见Position-Adjusted Word CountPAWC位置加权词数在词数基础上按引用出现的位置加权——出现在答案开头的引用权重更高因为用户注意力和答案前半部分的绑定最强。论文的主要实验均以 PAWC 为核心指标Subjective Impression主观印象可见度不只是占了多少字还包括被如何描述。作者采用 LLM-as-judge 的方式从相关性、影响力、独特性、引用位置、引用数量等维度对来源在答案中的呈现质量打分。这套指标的意义在于它把AI 有没有提我这个玄学问题拆成了可测量、可比较的实验变量而且区分了量词数、位置与质主观印象两个层面。当然用 LLM 评价 LLM 存在循环论证的争议作者在局限性讨论中也承认了这一点PAWC 作为纯客观指标因此成为全文结论的主要依据。四、评测基准 GEO-bench有了指标还需要有代表性的测试集。论文构建了 GEO-bench1 万条真实用户查询覆盖 25 个领域聚合自 9 个已有数据集并为每条查询配备了回答所需的网页来源。领域覆盖从事实问答到观点辩论、从法律到历史这种广度不是摆设——后文的领域差异结论正是依赖这个设计才得以发现。代码和数据全部开源generative-engines.com/GEO这让 GEO 成为一个可复现、可对比、可持续推进的研究方向而不是一次性结论。从 KDD 审稿标准看提出新问题 给出基准 开源是一个完整贡献的标准形态这也是这篇论文能在众多 LLM 应用论文中站住的原因。五、与相关研究的关系把这篇论文放到研究脉络里看定位会更清晰。一是与 RAG 研究的关系。检索增强生成方向已有大量工作论文引用了 Gao 等人 2023 年的 RAG 综述但绝大多数站在系统开发者一侧研究怎么把检索和生成做得更好而这篇论文反过来站在内容生产者一侧把引擎当作不可更改的黑盒研究输入端网页内容能对输出端答案引用施加什么影响。视角的翻转是它的原创性所在。二是与 SEO 研究的关系。传统 SEO 优化的是排序算法的输出有 PageRank 以来二十多年的积累而生成式引擎的输出是一段合成文本排名不复存在可见度需要重新定义。论文的核心动作正是为这个新对象建立度量体系——先定义指标再谈优化这个顺序在方法论上是严谨的。三是与黑盒优化的关系。作者明确将 GEO 建模为黑盒优化问题内容创作者无法接触模型参数和检索逻辑能调整的只有自己发布的内容能观测的只有生成答案中的引用情况。这个设定决定了实验设计必须依赖大规模查询采样和统计对比而不是白盒分析。六、实验九种内容改写方法实验设计本身很干净对同一批网页内容分别施加九种改写策略观测可见度指标的变化。九种方法可以分为三组来理解内容可信度组事后看效果最好Quotation Addition引述添加在文本中加入相关来源的原话引用。注意是逐字引用verbatim不是转述Statistics Addition数据添加把很多大部分这类定性表述替换为具体数字Cite Sources引用来源为论断标注出处Authoritative权威化表述用更有说服力、更专业的语气改写。文本特征组效果中等或有限Fluency Optimization流畅度优化改善文本流畅性与可读性Technical Terms术语添加增加专业术语Unique Words独特词汇增加不常见词汇Easy-to-Understand简化表达让文本更通俗易懂。传统 SEO 对照组Keyword Stuffing关键词堆砌提高目标关键词密度。这是传统 SEO 的经典手法放进实验里相当于一个旧时代基线。实验主体在 GPT-3.5 搭建的测试系统上进行检索源取 Google 前五名结果另取 200 条查询在真实线上引擎 Perplexity 上做外部验证。七、关键发现与解读发现一内容侧的改写确实有效且有效的是内容性手段而非技术性手段。PAWC 指标下Quotation Addition 提升约 41%单项最高Statistics Addition 约 31%Cite Sources 在事实类查询中效果最佳头部方法整体取得 30%–40% 的相对提升。Subjective Impression 上这些方法也有 15%–30% 的提升——即不仅影响是否被提及还影响被如何描述。这几个方法的共同点是把内容变得更可信、更可查证。一个合理的机制解释是大模型在合成答案时天然偏好那些看起来有依据的文本因为它自己也在追求答案的可信度。发现二关键词堆砌失效GEO 不是 SEO 换皮。Keyword Stuffing 在生成式引擎中不仅无效部分场景还会降低可见度。这是全文传播最广的结论之一原因不难理解传统排序算法对词频信号敏感而大模型是阅读者冗余重复对它而言是噪声而非信号。两类系统消费文本的方式根本不同——一个做匹配一个做理解。发现三效果存在显著的领域差异。数据添加在法律与观点类查询中最有效权威化表述适合辩论与历史类查询标注来源适合事实类查询。作者的结论是需要领域特定的优化策略不存在通用最优解。这个发现对实践的提示比任何单一数字都重要盲目套用某一种方法可能恰好用在了它表现平平的领域。发现四低排名来源的边际收益更大。原本在检索中排第 5 的来源使用 Cite Sources 后可见度提升 115.1%。头部来源本来就高频被引提升空间有限GEO 在一定程度上削弱了既有的排名优势。论文将此视为对中小内容生产者的利好在生成式引擎里内容质量对可见度的影响权重上升了既有权重的护城河变窄了。发现五方法可以组合。论文还测试了多种方法的组合使用在单项最优的基础上还能获得进一步提升具体组合与数字见原文实验部分。这说明各方法作用的机制不完全重叠——可信度和可读性是可以叠加的增益。发现六有效方法与好写作高度重合。把五个发现放在一起看会浮现出一个超出论文本身的图景Quotation Addition、Statistics Addition、Cite Sources 这三种最有效的方法恰好对应新闻写作和学术写作里最古老的纪律——引用原话、给出数字、标注出处。生成式引擎作为一个阅读者它的偏好与受过训练的人类编辑的偏好惊人地一致。这个一致性未必是巧合大模型的训练语料本身就是人类高质量文本它对可信文本的判别标准正是从这些文本里学来的。八、读数据时的三个注意事项这篇论文流传很广但几个数字经常被误读这里按原文校准1.最高提升 40%是上界而非平均效应。它是特定方法在特定领域、特定实验设置下的最优结果。线上引擎 Perplexity 验证中的提升约为 22%–37%明显低于测试系统内的数字说明结论的外部效度有限真实世界中的增益应当预期得更为温和。2.实验基于 2024 年的系统。测试环境是 GPT-3.5 和当时的 Perplexity。大模型和检索架构都在快速迭代方法效果的排序在新系统上是否稳定需要持续复测论文本身也承认这一点。3.41% 对应的是 Quotation Addition不是数据添加。这个数字在大量二手资料里被安到 Statistics Addition 头上以原文为准。引用这类研究时核对一手来源是基本功。九、局限性与开放问题指标与真实价值的距离可见度衡量的是答案中的引用份额不等于真实流量、点击或任何终端价值。零点击场景下被引用本身价值几何论文没有也无法回答评价循环Subjective Impression 依赖 LLM 评判用模型评价模型结论的稳健性有折扣外部验证规模有限线上验证仅 200 条查询、单一引擎。更多引擎、更大样本的验证是明确的后续方向干预范围有限论文只测试了文本改写未涉及结构化数据、站点架构、多模态内容等更外围的因素攻防演化引擎方也在持续调整检索与引用策略内容侧的优化与引擎侧的反优化之间是否会形成类似 SEO 与搜索引擎之间持续数十年的军备竞赛是一个开放的观察窗口。十、结语这篇论文的价值不止于几个百分比数字。它第一次把内容如何被生成式引擎引用变成一个定义清晰、可测量、可复现的研究问题有明确的问题形式化黑盒优化、有可复用的基准GEO-bench、有设计过的指标PAWC 等、有覆盖正反两面的实验结论引述有效、堆砌无效。而实验给出的答案本身也颇有意味能被 AI 答案青睐的内容恰好就是那些本来就写得更扎实的内容——有数据、有出处、有引述、表述明确。针对旧算法的投机手段在新架构里失效了而把内容写好这个最古老的原则反而第一次获得了顶会级别的量化背书。对技术写作者来说这大概是最让人安心的一类研究结论。参考资料1. Aggarwal P., Murahari V., Rajpurohit T., Kalyan A., Narasimhan K., Deshpande A. *GEO: Generative Engine Optimization*. KDD 2024. arXiv:2311.09735, DOI: 10.1145/3637528.36719002. 论文开源代码与 GEO-bench 数据https://generative-engines.com/GEO/3. Gao Y., Xiong Y., Gao X., et al. *Retrieval-Augmented Generation for Large Language Models: A Survey*. arXiv:2312.10997, 2023