直接回答:主流 AI 搜索走的是"检索增强生成"(RAG)链路,可以拆成五步——改写问题 → 检索候选 → 重排筛选 → 读取正文 → 生成答案并标注来源。你的内容在每一步都可能被淘汰,而绝大多数站点只优化了最后一步的内容质量,忽略了前面四步。
先看完整链路
1 | 用户提问 |
下面逐段说明每一层在淘汰什么,以及你能做什么。
第 ① 步:查询改写
用户问的是"我们公司想做 GEO,从哪下手",系统会改写成若干检索式,例如:
GEO 落地步骤生成式引擎优化 实施清单企业 GEO 从哪里开始
这一层淘汰的是"术语不一致"的内容。 如果你的文章只写"生成式引擎优化",而用户和改写结果用的是"GEO"或"AI 搜索优化",可能根本进不了候选集。
可执行动作:
- 标题用主流叫法,正文开头补上同义解释。例如:"GEO(生成式引擎优化,也叫 AI 搜索优化)……"
- 在站点上建立统一的术语表页面,让同一个概念有稳定的名称。
- 别为了显得专业而自创术语,除非你打算同时定义清楚。
第 ② 步:召回检索
系统把网页切分成片段(常见粒度是几百字),做向量化后存起来。提问时做相似度检索,捞出候选。
这一层淘汰的是"切不出好片段"的内容。
切分通常沿着标题层级和段落边界进行。如果你的文章是一整坨没有小标题的长段落,切分后每个片段都语意混杂,向量表示会变得"平均",反而跟任何具体问题都不够像。
可执行动作:
- 用
h2/h3把文章切成语义完整的小节,每节 200 到 500 字为宜。 - 每个小节的第一句就是这个结论本身,别用"众所周知""话不多说"开场。
- 关键事实、数字、步骤写在正文里,不要只放在图片或代码注释中。
第 ③ 步:重排排序
召回结果通常是过量的,系统会用更精细的模型打分,只留下几个最相关的片段。打分时常见的偏好是:
- 与问题的直接相关性
- 是否包含明确的事实、数字、步骤
- 来源的可信度(作者、站点声誉、是否有引用来源)
- 信息的新鲜度
这一层淘汰的是"没有信息量"的内容。 含糊其辞、通篇铺垫、观点没有依据的段落,在这个阶段会被同领域的硬核内容挤掉。
可执行动作:
- 把结论、数字、前提条件写清楚,例如"在 4 核 8G 的 ECS 上,构建耗时约 40 秒"。
- 给出适用边界:"这个方法适合日更不超过 3 篇的站点,超过就需要增量构建。"
- 标注真实更新时间,让系统知道这不是 2019 年的老文。
第 ④ 步:正文读取
进入这一层的页面会被实际抓取读取。这一层淘汰的是"抓不到、解析不了"的内容。
常见问题:
| 现象 | 后果 | 处理方式 |
|---|---|---|
| 正文靠 JavaScript 渲染 | 抓到空壳 HTML | 静态生成或服务端渲染 |
被 robots.txt 拦截 |
无法抓取 | 允许 AI 爬虫 |
| 需要登录或验证码 | 无法抓取 | 核心内容放在公开页面 |
| 正文藏在图片里 | 无法解析 | 关键信息写成文字,图片加 alt |
| 无限滚动、分页碎片化 | 只能抓到一部分 | 提供完整单页或分页链接 |
第 ⑤ 步:生成答案与标注来源
模型综合片段写答案,并给出引用。这里有两个细节值得注意:
第一,引用往往指向片段所在的页面,而不是你期望的首页。 所以每一篇文章都应该被当成独立入口来写,标题和描述要能独立成立。
第二,模型会回避不确定的来源。 一个没有任何作者信息、没有发布日期、没有任何外部引用的页面,即使内容不错,也更难被选为引用对象。
可执行动作:
- 每篇文章配一个能独立说明问题的标题和描述。
- 建立作者页面,写清身份、经验范围和联系方式。
- 关键结论给出可核查的外部来源(论文、官方文档、规范)。
- 用 JSON-LD 补充
BlogPosting、BreadcrumbList、FAQPage等结构化数据。
把五步映射成一张检查表
| 步骤 | 关注点 | 你的动作 |
|---|---|---|
| ① 改写 | 术语一致 | 标题用主流叫法,正文补同义词 |
| ② 召回 | 片段质量 | 小标题切分,每节一个完整语义 |
| ③ 重排 | 信息密度 | 结论先行,给出数字与适用边界 |
| ④ 读取 | 可抓取性 | 静态内容、允许爬虫、避免 JS 依赖 |
| ⑤ 引用 | 来源可信 | 作者、时间、引用来源、结构化数据 |
常见问题(FAQ)
大模型是怎么"看到"我的网页的?
大多数 AI 搜索用的是检索增强生成(RAG)。系统先把你的网页抓取并切分成片段,存进向量数据库;用户提问时,用问题去检索最相关的片段,把它们拼进提示词交给模型,模型再根据这些片段组织答案。所以模型看到的往往不是你的整个页面,而是被切分后的若干片段。
为什么不设置 robots 也可能被引用?
训练语料和检索索引是两个不同的通道。有些模型的知识来自早期训练数据,即使你现在屏蔽爬虫,历史知识仍可能被复述。但实时检索通道会尊重 robots.txt 与访问限制,屏蔽之后新内容就很难被引用。
页面被切成片段后,标题还有用吗?
有用,而且比传统 SEO 更重要。片段在检索和重排时经常脱离上下文单独参与计算,段落自己的小标题往往就是它唯一的语义锚点。写清楚每个 h2 / h3,等于给每个片段贴了标签。
小结
理解这条链路之后,GEO 就不再是玄学:它是在为"片段"而不是"页面"做优化。 具体到写作上,就是让每一小段都能独立地被读懂、被复用、被核查。
接下来可以看两篇偏工具的:《llms.txt 完全指南》和《结构化数据怎么做才对 GEO 有用》。
如果你的内容始终没被引用过,欢迎到留言板说说具体情况,可以一起看是卡在抓取、理解还是信任这一层。