首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >GEO介绍:什么是生成式引擎优化

GEO介绍:什么是生成式引擎优化

原创
作者头像
用户12711983
修改2026-08-27 15:15:51
修改2026-08-27 15:15:51
210
举报

一、什么是GEO

生成式引擎优化(Generative Engine Optimization,简称GEO)是近年来随着生成式人工智能兴起而出现的一个新兴研究领域。它研究的是:当生成式引擎(即以大语言模型为核心、能够直接合成答案的AI系统)在回答用户问题时,如何影响其选择和引用外部信息的机制,以及如何让特定内容更容易被这类系统理解、采信并纳入其生成的答案之中。

需要强调的是,GEO首先是一个学术概念。2023年底,普林斯顿大学、佐治亚理工学院等机构的研究人员发表了题为《GEO: Generative Engine Optimization》的论文(后发表于数据挖掘顶级会议KDD 2024),首次系统性地提出这一概念。研究者观察到,随着ChatGPT等生成式引擎的普及,信息在互联网上的呈现与传播方式正在发生深刻变化,传统面向搜索引擎的内容优化方法在新的环境下逐渐失效,因此有必要建立一套针对生成式引擎的理论框架。

在这篇论文中,研究者设计了一种灵活的黑盒优化框架:给定一个内容源,通过对内容的呈现方式、文本风格、信息结构等进行系统性调整,从而改变其在生成式引擎中的可见程度。由于主流生成式引擎的内部算法都是闭源的,研究者无法通过查看内部参数来精确调控,只能通过不断调整输入、观察输出结果来逼近目标,这正是"黑盒优化"的含义。

论文的另一项重要贡献,是提出了针对生成式引擎的可见度度量框架。研究者指出,在生成式引擎中,"可见度"比传统搜索引擎中的"排名"更加复杂和多维:它不仅包括内容是否被引用,还包括被引用的位置、被正确引用的程度,以及在不同类型问题下被提及的频率。这套度量框架为后续研究提供了基础。

值得一提的是,GEO与地理信息领域常说的"本地搜索优化"(Local SEO,有时缩写为Geo SEO)是两个完全不同的概念,前者面向生成式AI引擎,后者面向地图与本地搜索场景,需要加以区分。

二、诞生背景:生成式引擎的兴起

理解GEO,需要先理解它诞生的技术背景——生成式引擎的快速普及。

传统搜索引擎的工作方式是"检索并罗列":用户输入关键词,搜索引擎返回一页网页链接列表,由用户自行选择点击。而生成式引擎的工作方式是"检索、理解并合成":面对用户的问题,系统先检索相关信息,再由大语言模型将这些信息重新组织成一段连贯、完整的自然语言答案,直接呈现给用户,而不是给出链接列表。

这两种方式有着本质区别。在传统搜索模式下,信息是否被用户看到,取决于网页在结果页中的排序位置;而在生成式引擎模式下,用户直接阅读AI合成的答案,几乎没有点击链接的动作,信息是否被用户获取,取决于它是否被AI纳入答案之中。

这一变化并非停留在理论层面。从实际使用数据看,生成式AI的用户规模在过去两年经历了爆发式增长。据中国互联网络信息中心(CNNIC)发布的《中国互联网络发展状况统计报告》,截至2026年初,中国生成式AI用户规模已达6亿以上。与此同时,多项行业调研显示,相当比例的用户在获得AI给出的答案后,不再返回传统搜索引擎逐条浏览。这表明,生成式引擎正在成为许多人获取信息的常态化入口。

正是这种信息获取方式的迁移,使得"内容如何被机器选择"成为一个值得系统研究的问题,GEO正是在这一背景下进入研究者和业界的视野。

三、技术原理:生成式引擎如何生成答案

要理解GEO的研究对象,需要先了解生成式引擎生成答案的技术流程。当前主流生成式引擎普遍采用检索增强生成(Retrieval-Augmented Generation,简称RAG)架构,其工作流程大致可分为三个阶段。

第一阶段:检索。 用户提出问题后,系统先对问题进行语义理解,有时还会将复杂问题拆解为若干子问题,然后从内容索引中召回一批相关的文档片段。这一阶段与信息检索领域的传统检索逻辑类似,依赖内容能够被系统抓取、建立索引,并且与问题主题相关。

第二阶段:排序与筛选。 召回的候选文档按照与问题的相关性、内容的新鲜度、来源的权威性等维度进行综合排序,同时叠加质量和安全过滤规则。这一阶段的排序偏好与具体引擎的算法设计有关,例如部分引擎会明显倾向于引用更新鲜的信息。

第三阶段:合成。 大语言模型阅读排序靠前的文档,从中抽取事实性论断,经过推理和整合,生成一段连贯的自然语言答案,并在答案中标注信息来源。需要特别指出的是,AI并非简单地"指向"某篇文档,而是对文档内容进行了"改写式"的重新组织——它抽取的是段落层面的信息,而非整页内容。

对于GEO研究而言,第三阶段是最关键的环节。研究者通过实验发现,内容表达方式的不同会显著影响其在合成阶段被采用的概率。在普林斯顿团队的研究中,仅通过对内容表达方式进行优化,页面在合成答案中的可见度最高可提升约40%,且原本排名越靠后的内容收益越明显。这一发现揭示了一个重要现象:即使内容能够被成功检索和排序,如果在表达上不利于机器抽取,仍然可能被生成式引擎"读过却不用"。

四、GEO研究什么

作为一门新兴研究方向,GEO的研究内容大致可以归纳为几个方面。

其一是可见度的度量。既然生成式引擎中的"可见度"是多维的,如何科学地度量它就成为研究的基础问题。研究者提出,可以从引用频率、引用位置、正确引用程度、场景覆盖度等多个维度构建度量指标,并在此基础上比较不同内容在生成式引擎中的表现差异。

其二是优化机制的探索。生成式引擎的算法不透明,GEO研究采用黑盒测试的方法:通过系统性地调整内容的各种属性——包括结构、风格、措辞、数据呈现方式等——观察可见度指标的变化,从而反向推断影响引擎选择的因素。这种"假设—实验—归因"的循环,是GEO研究的基本方法论。

其三是影响因素的分析。通过大量对照实验,研究者试图回答"什么样的内容更容易被生成式引擎采信"这一核心问题。目前已经积累了一些具有共性的观察结果,这些结果更多是研究者对引擎行为的描述性总结,而非某种固定不变的规则——因为引擎的算法本身也在持续更新。

其四是框架与工具的建设。包括建立可复用的评估基准、开发自动化测试工具、构建标准化的实验流程等,目的是让这一领域的研究更加规范和可比较。

五、GEO与传统SEO的概念辨析

GEO常被与搜索引擎优化(Search Engine Optimization,简称SEO)相提并论,二者既有联系又有显著区别,理解这种关系有助于把握GEO的定位。

从优化目标看,传统SEO以提升网页在搜索结果页中的排序为目标;GEO则以提升内容在生成式引擎合成答案中的采用概率为目标。前者关注"排在第几位",后者关注"答案里有没有、怎么被提及"。

从核心机制看,传统SEO依赖关键词匹配与链接权重,搜索引擎通过关键词密度、外链数量、页面权重等信号评判网页与查询的相关性;GEO依赖语义理解与可信度评估,生成式引擎通过理解内容的深层含义、事实的完整性、信息组织的清晰程度来作出判断。

从用户交互方式看,传统SEO对应的用户路径是"搜索—点击—浏览",用户需要点击链接才能获取信息;GEO对应的用户路径是"提问—获得答案",用户直接从AI合成的答案中获取信息。

从评估指标看,传统SEO以关键词排名、点击率、自然流量等为核心指标;GEO则需要以引用率、引用位置、语义关联度等新的指标体系来衡量。

尽管差异显著,二者并非互相排斥。在技术链条上,GEO研究通常建立在内容能够被检索到这一前提之上——如果内容根本无法被系统抓取和索引,那么讨论其是否被采信便没有意义。因此,更恰当的理解是:传统SEO解决"内容能否被发现"的问题,GEO关注"内容能否被机器理解与采信"的问题,二者处于信息流转链条的不同环节。

六、关于生成式引擎的争议与反思

生成式引擎的兴起,也带来了一系列值得讨论的问题,这些问题构成了GEO研究的重要背景。

最突出的是"黑盒"问题。生成式引擎的内容选择机制高度不透明,研究者只能通过外部观察来推测其内部逻辑,这导致相关研究带有一定的经验性和不确定性。不同引擎之间的行为差异也很明显,某一引擎的偏好未必适用于另一引擎。

其次是内容与来源的关系问题。当AI将多个来源的信息重新组织成一段答案时,来源信息在传输过程中可能发生偏差,甚至出现"幻觉"——即模型生成了看似合理但并非事实的内容。如何在"信息整合"与"信息保真"之间取得平衡,是生成式引擎以及相关研究共同面对的难题。

此外,还有关于"谁在影响机器选择"的伦理讨论。当内容是否被采信取决于机器算法时,如何保证这一过程是公平、透明、可解释的,避免算法偏好造成的信息偏见,是需要持续关注的问题。GEO作为研究机器如何选择内容的领域,天然与这些问题交织在一起。

七、未来研究方向

展望未来,GEO研究可能会沿着几个方向深入。

一是多模态内容的处理。随着生成式引擎对图片、视频、音频理解能力的增强,如何度量并优化非文本内容在生成式引擎中的可见度,将成为新的研究课题。

二是评估体系的完善。目前GEO领域尚缺乏统一、公认的评估标准,建立规范化的可见度度量与评估基准,是推动该领域走向成熟的关键一步。

三是引擎行为演进的追踪。生成式引擎的算法在持续迭代,其内容选择逻辑也在不断变化,长期、系统地追踪这种演进,有助于建立更具鲁棒性的理论框架。

四是与社会科学的交叉。生成式引擎如何影响公众的信息获取、认知形成乃至社会传播结构,是比单纯的技术优化更宏观的议题,需要与传播学、社会学、信息伦理等领域共同探讨。

八、结语

GEO是伴随生成式人工智能兴起而出现的新兴研究方向,它关注的是机器如何理解、选择与整合信息这一核心问题。从学术论文的提出到业界的热议,短短两年间,这一概念迅速进入公众视野,折射出信息生态正在发生的深层变革——当机器开始替人"读内容"并"写答案",信息的意义不仅取决于能否被人类看到,也取决于能否被机器准确理解。

对普通读者而言,了解GEO的意义不在于掌握某项具体技术,而在于理解一个正在发生的变化:我们获取信息的方式,正在从"在列表中选择"走向"由机器合成";而这一变化,正在重新定义内容、来源与可信度之间的关系。真实、清晰、可验证的信息,在任何技术时代都具有不变的价值——理解了这一点,也就理解了GEO所指向的方向。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 一、什么是GEO
  • 二、诞生背景:生成式引擎的兴起
  • 三、技术原理:生成式引擎如何生成答案
  • 四、GEO研究什么
  • 五、GEO与传统SEO的概念辨析
  • 六、关于生成式引擎的争议与反思
  • 七、未来研究方向
  • 八、结语
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档