# DevNotes(全文纯文本版) > 我是 AI 的积极拥护者。这里记录我在 AI 周边的一些实践——用过什么、怎么搭起来的、踩过哪些坑。GEO(生成式引擎优化)只是我关注的方向之一。 生成时间:2026-09-17|文章数:22 许可证:CC BY-NC-SA 4.0,引用请注明出处:https://devnotes.cuiyuehui.cn/ ======================================================================== ## 内容被 AI 改写后传播,该如何处理 - 原文链接:https://devnotes.cuiyuehui.cn/posts/content-rewritten-by-ai/ - 发布时间:2026-09-17 - 分类:GEO 入门 - 标签:GEO / 内容写作 / 版权 / AI 引用 直接回答:先分清三种情况——有出处的引用(想要的结果)、无出处的改写(最常见,也是最难处理的)、整篇搬运(可以投诉)。三种情况的目标不同:引用要争取更多,改写要靠溯源能力化解,搬运才需要动用投诉渠道。与其防止被抄,不如让愿意查证的人能轻松找到源头。 三种情况要分开看 很多人把这几件事混在一起,于是处理方式也就不对了。先分类: 情况 | 表现 | 合理目标 | 有出处的引用 | 答案里标注了你的站点或作者 | 争取更多,属于正向结果 | 无出处的改写 | 观点、结构、数据出现在别处,但没有署名 | 让溯源变容易,降低洗稿收益 | 整篇搬运 | 全文复制到其他站点 | 走投诉渠道,同时做技术标记 | 第一种是你想要的,所以别把它和侵权混为一谈——有人因为 AI 回答里的引用而找到你,这是引用的价值所在。 无出处的改写为什么最难处理 这是最常见的形态:内容被重新组织、换了措辞,观点和结论还是你的,但没有任何指向你的线索。 它的特点是: 难以举证:改写过后的文字不构成逐字复制 数量庞大:可能是模型生成的答案,也可能是其他站点二次加工 无处投诉:内容可能出现在你无法触达的渠道里 在这种情况下,追求"阻止它发生"是不现实的,能改变的是"它发生后别人能否找到你"。 让溯源变容易,比防止被抄有效 核心思路是:当有人看到被改写的内容、想确认原始出处时,能不能顺利找到你。 能做到这一点的内容,即使被大量改写,也会有一部分读者最终回流到源头。具体可以做四件事: 做法 | 作用 | 结构化数据声明作者与站点 | 让模型在引用时能拿到归属信息 | 建立作者页,集中说明身份与方向 | 给"这是谁写的"一个可验证的落点 | 在文末加固定署名与出处提示 | 被摘录时有机会带上一行来源 | 发布 llms.txt 声明站点内容导览 | 向模型明确站点结构与主要文章 | 前三项的做法分别见 《结构化数据怎么做才对 GEO 有用》与 《llms.txt 完全指南》。 **一个反直觉但重要的判断:被改写传播本身不完全是坏事。**它意味着你的观点进入了更大的流通范围。真正让你损失的是"流通了但没人知道是你"——所以重点在于降低这种匿名流通的比例。 许可声明要说清楚,但别指望它能拦住谁 在页脚或文章末尾声明许可方式(比如 CC BY-NC-SA、或"转载请注明出处")是标准做法: 它能让愿意遵守规则的人明确知道该怎么做 它不能拦住不打算遵守的人 所以值得写,但不要把它当成保护手段。声明的真正价值在于降低"善意使用者"的犯错概率,而不是威慑恶意搬运。 现实中的边界,要提前知道 这一部分需要诚实说明,避免预期错位: 识别与举证成本高:改写后的内容很难自动匹配到原文,靠人力搜索覆盖面有限 跨平台投诉效率不一:不同渠道的处理速度与标准差别很大 法律途径成本高:适合处理影响大、证据明确的个案,不适合日常纠纷 AI 生成的答案无处投诉:模型输出不是可投诉的对象,能做的只有影响它的检索来源 **结论是:把主要精力放在"可被溯源",而不是"追究责任"。**涉及严重侵权、商业损失的情况,建议咨询专业人士,而不是自己耗在投诉流程里。 一个更实际的判断标准 遇到内容被改写传播时,先问自己一个问题: 读者如果想核实这段话,能不能在三步之内找到我? 如果答案是"能",那这件事的危害有限。如果答案是"不能",那么真正要修的是溯源链路,而不是去追那一个改写者。 常见问题(FAQ) 被 AI 回答引用但没给链接,算侵权吗? 通常不算,但也没达到你想要的效果。**模型提到你的观点却不给出处,属于"提及",价值低于"引用"。**能改善的方向是让归属信息更容易被读取——结构化数据和作者页就是为此服务的。 要不要用技术手段禁止内容被采集? 代价通常高于收益。加固反爬、限制访问会影响正常读者和搜索引擎,而这些渠道恰恰是引用的来源。除非内容本身有商业独占要求,否则不建议以牺牲可抓取性为代价做防护。 需要给每篇文章加水印或指纹吗? 可以有,但要理解它的作用边界:水印能帮助事后举证,不能阻止改写。对大多数内容站点来说,把同样的精力用在结构化数据与作者页上,实际收益更直接。 读者把内容转发到别的平台,要处理吗? 转发通常有利于传播,只要不冒充原创、不篡改结论,一般不必处理。可以提前在文末写清转载规则,让愿意遵守的人有章可循,比事后沟通省事。 小结 分清引用、改写、搬运三种情况,它们的目标完全不同。 有出处的引用是正向结果,不要和侵权混为一谈。 无出处改写难以追责,能改变的是让溯源更简单。 四项措施:结构化数据、作者页、文末署名、llms.txt。 判断标准:读者想在三步之内核实一段话,能不能找到你。 如果对这些概念的来龙去脉还不熟,建议先看 《什么是 GEO》。 如果你遇到过内容被改写传播的情况,欢迎到 留言板说说你是怎么处理的,这类经验对其他人很有参考价值。 ------------------------------------------------------------------------ ## 中文内容在 AI 搜索里的表现比英文差吗 - 原文链接:https://devnotes.cuiyuehui.cn/posts/chinese-content-ai-search/ - 发布时间:2026-09-17 - 分类:GEO 入门 - 标签:GEO / AI 搜索 / 中文 / 抓取 直接回答:不是笼统的"差",而是三个具体差异在起作用——中文优质内容更多被关在禁止抓取的平台里、中文检索依赖分词且术语变体更多、训练语料里中文占比更低。前两项有明显的应对办法,第三项超出个人能改变的范围,但它不是决定性的。 差异一:大量中文内容根本不在可抓取范围里 这是三个差异中最容易被忽略、也最容易验证的一个。 中文互联网的优质内容很大一部分沉淀在需要登录或明确禁止抓取的产品里。实测几个平台的 robots.txt(2026 年 9 月 17 日): 平台 | 抓取策略 | 知乎 | 通配组基本 Disallow: /,并单独声明 Google-Extended 禁止 | 微信公众号 | 通配组仅放行少数路径,其余 Disallow: / | CSDN、博客园、掘金、简书 | 允许抓取 | 对比英文互联网:个人站点和独立博客是主流形态,绝大多数默认允许抓取。所以中文内容"表现差"的第一层原因不是质量问题,而是可检索的供给量本来就少。 这一项恰恰是个人可以改变的:把内容放在自有域名上,而不是只沉淀在禁止抓取的平台里。平台策略的完整实测见 《博客、公众号、知乎,哪个更容易被 AI 引用》。 差异二:中文检索对术语一致性更敏感 检索系统处理英文时按词切分,处理中文时要先分词——这一步会放大术语变体带来的损耗。 英文里"GEO"和"generative engine optimization"是两个明确的字符串;中文里同一个概念可能是: GEO 生成式引擎优化 生成式引擎优化(GEO) AI 搜索优化 大模型优化 不同作者各用各的写法,读者的提问又是第六种说法。分词之后,这些变体之间并不天然等价,命中率因此下降。 还有一层:中文没有空格,切分歧义更多。"生成式引擎优化"可能被切成"生成/式/引擎/优化"或"生成式/引擎/优化",不同切法对应的语义略有差别。 可执行的对策有两条: 标题用最主流的叫法,正文第一段补上括注的同义解释。比如"GEO(生成式引擎优化,也叫 AI 搜索优化)"。 在整篇文章里保持术语统一,不要同义词交替使用。同义词对读者友好,对检索不友好。 差异三:语料分布确实不均衡,但它不是决定因素 训练语料里英文占比高于中文,这是公开可观察的事实。但我没有可靠的中文占比统计数据,所以不在这里给具体数字——网上流传的比例多有引用错误,不适合当作依据。 需要理解的是这个差异的实际影响边界: 它影响的是模型对中文内容的"熟悉度",以及某些领域中文资料是否足够 它不影响你的内容能否被检索、能否被切分、能否被归属 引用发生在检索环节,决定因素是内容与问题的匹配度,而不是语言的先天权重 换句话说:**语料分布是背景条件,不是你能操作的变量。**把注意力放在能改变的部分更实际。 三个差异里,你能改变两个 把三件事分开看,优先级就清楚了: 差异 | 能改变吗 | 怎么做 | 平台禁止抓取 | ✅ 可以 | 内容放在自有域名,平台只做分发 | 术语变体多 | ✅ 可以 | 标题用主流叫法,正文补同义解释并保持统一 | 语料分布不均 | ❌ 不能 | 作为背景接受,不据此调整策略 | **结论是:中文内容做 GEO 的可行空间并没有想象中那么小。**真正的瓶颈通常在第一项——内容放错了地方。 怎么验证自己的情况 与其相信概括性结论,不如测自己的题材。方法很简单: 选 5 个你关心的真实问题 每个问题准备中英文两个版本 在 3 到 4 个平台各问一遍,记录是否引用、引用了哪个来源、来源是中文还是英文 两周后重复一次 这样得到的是你自己领域里的实际差异,比任何通用结论都有参考价值。记录方式可以沿用 《怎么衡量 GEO 有没有效果》里的采样表。 一个常见的实测结果是:技术类问题里,英文来源的引用占比确实更高;但如果中文侧存在结构清晰、术语统一的独立站点内容,被引用的概率会明显高于平台内容。 常见问题(FAQ) 中文站点是不是应该改成英文? 不建议。语言选择应该由读者决定,而不是由检索偏好决定——**你的内容是写给谁看的,比它能不能被某个模型引用更重要。**中英双版本是可行方案,但要确保两个版本各自完整、不要互相稀释。 中文术语一定要用英文缩写吗? 建议中英并列而不是只写缩写。首次出现时写"GEO(生成式引擎优化)",之后统一用其中一个。读者里既有搜英文缩写的,也有搜中文全称的,两者都覆盖到最稳妥。 把内容翻译成英文发布,会有额外收益吗? 可能有,但要权衡成本。翻译版本要能被正确归属、要指向原作者、地址要稳定,否则容易被当成重复内容。如果精力有限,把中文内容的质量和结构做好,收益通常高于多语言扩张。 中文内容要多久才能看到引用? 与新站被引用的周期一致,通常是被正常抓取之后的两周到几个月。语言本身不会显著拉长这个周期,决定因素仍然是抓取、索引与内容增量。 小结 中文内容的劣势可以拆成三个具体差异,而不是一个笼统印象。 最大的一项差异是可抓取供给少——大量优质内容被关在禁止抓取的平台里。 中文检索依赖分词,术语保持统一能明显降低损耗。 语料分布不均属于背景条件,不可控,也不该成为放弃的理由。 三个差异里有两个可以自己改变,先做这两件。 想从整体上理解这套机制,可以从 《什么是 GEO》读起。 如果你测过中英文内容在你领域里的引用差异,欢迎到 留言板分享结果,这类样本目前很缺。 ------------------------------------------------------------------------ ## 小团队做 GEO 的第一个月该做什么 - 原文链接:https://devnotes.cuiyuehui.cn/posts/geo-first-month/ - 发布时间:2026-09-17 - 分类:GEO 入门 - 标签:GEO / 内容写作 / 行动指南 / 排查 直接回答:第一个月的目标不是"提升引用率",而是把链路打通并留下一个可对比的基线。四周分别是:确认抓取与索引、改造内容结构、补齐信任信号、建立采样机制。做完这四件事,你才知道后面该往哪里使劲。 为什么第一个月不要盯着引用率 引用率的反馈周期是几周到几个月。如果第一个月就拿它当指标,你会得到一堆噪声,然后开始乱改。 这一个月真正要拿到的是两样东西: 一条确认畅通的链路(抓得到、进得了索引、切得出片段) 一份基线数据(现在被引用了几次、哪些问题命中) 有了基线,之后的每一点变化才有参照。 第一周:确认抓取与索引是通的 这一周不做内容,只做检查。因为后面所有工作都建立在这条链路之上。 动作 | 通过标准 | 用爬虫 UA 请求首页与两篇文章 | 全部返回 200 且含正文 | 查服务器日志里的 AI 爬虫 | 最近两周有访问记录 | 确认 robots.txt 放行检索类爬虫 | 没有通配 Disallow: / | 提交 sitemap.xml | 提交成功,抓取量有变化 | 搜 site:你的域名 | 主要页面已被收录 | 如果日志里从来没有出现过 AI 爬虫,先解决这一层,别急着写新内容。具体排查顺序见 《为什么 AI 从来不提我的网站》。 第二周:把内容结构改成"可切分"的 这一周做改造,不写新内容——优先改那些已经有人访问、主题明确的旧文章。 四个动作,按重要性排序: 每篇文章开头加一句"直接回答"。把最核心的结论压缩成两三句放在最前面,这是最容易被摘取的片段。 把 h2 改成判断句。片段脱离上下文时,标题是它唯一的语义锚点。对比一下:"优化建议"和"标题用主流叫法,正文补同义解释"。 单节控制在 200 到 500 字,超过就拆。切分粒度太粗会让片段语义混杂。 补齐 FAQ 小节。用 ### 问题 加一段答案的形式,写成真实会被问到的问题。 验收标准很简单:随便挑一节单独摘出来,看它能不能不依赖上下文独立成立。 第三周:补上信任信号 模型在挑选来源时会判断可信度。这一周补的是"这段内容由谁负责"的信息。 写一个真实的作者页:在做什么、关注什么方向,不要写成简历 给文章加结构化数据,至少要有 BlogPosting 和作者信息 统一全站的站点名、简介、头像,各平台说法保持一致 检查每个页面能否明确看出所属站点 结构化数据的落地方式见 《结构化数据怎么做才对 GEO 有用》,加完不生效的排查见 《结构化数据加了但没效果?先检查这四处》。 第四周:建立采样机制,留下基线 最后一周不做优化,做度量。没有基线,后面所有判断都是感觉。 具体做法: 准备 20 到 30 个真实用户会问的问题,覆盖三层:品牌类("某某是谁")、主题类("什么是 GEO")、长尾类("小网站值得做吗") 在 4 到 5 个平台各问一遍:ChatGPT、Perplexity、豆包、元宝、Kimi 记录三列信息:是否被引用、是否被提及、引用的是哪一篇 之后每两周重复一次,看趋势不看单点 指标设计可以参考 《怎么衡量 GEO 有没有效果》。第一轮记录下来的就是基线,它的价值在第两次采样之后才显现。 第一个月不要做的三件事 **不要为了"优化"改 URL 结构。**地址变动的代价是几周内的引用失效,而结构调整带来的收益远小于这个损失。 **不要批量生成内容。**一个月产出几十篇同质文章,只会稀释站点的整体可信度。四到八篇有信息增量的内容,效果更好。 **不要只看流量。**AI 引用带来的很大一部分是零点击曝光——用户在答案里看到了你的名字就离开了,这不会出现在流量统计里。 常见问题(FAQ) 一个月能看到效果吗? 看不到引用率明显上升是正常的,反馈周期通常要两三个月。第一个月的产出是确认链路通畅和拿到基线数据,这两件事决定了后面几个月有没有优化空间。 没有技术人员能做吗? 可以。第一周和第四周主要是检查与记录,第二周和第三周是写内容与填信息,都不需要写代码。唯一涉及配置的是结构化数据,静态博客和主流 CMS 都有现成的插件或模板可用。 需要买监测工具吗? 第一个月不需要。手动在四五个平台采样 20 多个问题,半小时能完成一轮,信息量比工具生成的报告更贴合你的实际情况。等采样变成负担了,再考虑自动化——本站的监测模块就是这么演变来的,见 《自建 GEO 平台的收录监测模块》。 团队里应该由谁负责这件事? 第一个月建议由一个人统筹,避免职责分散导致没人真正推进。内容结构改造需要写作者参与,抓取与索引的检查需要能接触服务器或站点后台的人。两边沟通成本不高,但必须有明确的负责人。 小结 第一个月的目标是打通链路加上拿到基线,不是提升引用率。 第一周查抓取与索引,问题在这一层时后面都白做。 第二周改造旧文章的结构,比写新内容见效更快。 第三周补作者页与结构化数据,解决"由谁负责"的问题。 第四周建立 20 条问题集与双周采样,后续所有判断都依赖这份基线。 如果你正准备开始,欢迎到 留言板说说你的站点类型和现状,可以一起看看第一个月该从哪一步入手。 ------------------------------------------------------------------------ ## 用 AI 写的内容,能不能被 AI 引用 - 原文链接:https://devnotes.cuiyuehui.cn/posts/ai-written-content-cited/ - 发布时间:2026-09-17 - 分类:GEO 入门 - 标签:GEO / AI 搜索 / 内容写作 / AI 生成 直接回答:能被引用。**模型不关心内容是人写的还是 AI 写的,它关心的是这段内容有没有别处拿不到的可用信息。**所以真正的问题不是"用了 AI",而是内容同质化——当同一套观点在每个站点都以相似措辞出现时,任何一篇都不再是必要的引用来源。 模型不会去检测"这段是不是 AI 写的" 先澄清一个常见误解:AI 搜索在挑选引用来源时,并不执行"AI 内容检测"这一步。 它做的事情可以概括成三件: 这段内容是否回答了当前问题 这段内容是否可靠(有没有来源、作者、上下文) 这段内容是否提供了别处没有的信息 所谓"AI 检测工具"是另一套技术,用于判断文本的生成特征,它既不在检索链路上,也不影响引用决策。 所以**"我用 AI 写的内容会不会被识别出来然后被降权"这个担心,方向是错的。**真正让你被忽略的,是第三个问题——你没有提供增量。 真正的障碍是同质化 AI 生成内容的典型特征是:结构工整、措辞得体、但可以替换。 比如问"怎么做 GEO",AI 通常会给出这样一套答案:优化内容质量、提升权威性、建立外链、做好结构化数据。正确,但没有区分度——这段话能出现在一万个站点上。 当检索系统面对一万篇内容相同的页面时,它只需要引用一篇,选择哪一篇带有随机性。你被引用的概率就是万分之一。 反过来,如果某篇文章写着: 我们在 12 个站点上测试了 robots.txt 配置,其中 3 个站点的 CDN 在 robots 允许的情况下仍然返回 403,原因是 WAF 把不带 cookie 的请求判定为爬虫。 **这段话只有这一个出处。**它不可替换,因此更容易成为被引用的那一个。 所以判断标准很清晰:你的文章里,有多少句子是"只有你能写"的? AI 写不出来的四类信息 不需要文笔,只需要有别人拿不到的东西。四类最容易积累的: 类型 | 说明 | 例子 | 一手实测 | 自己跑过的结果,包含具体数字 | "实测 480 字的片段检索命中率最高" | 失败与弯路 | 走不通的路径,比成功经验更稀缺 | "用 X 方案处理 3 万条数据时内存溢出" | 具体环境与版本 | 让结论可复现的关键细节 | "MySQL 8.0.34 + mysql_native_password" | 时间敏感的一手观察 | 你在某个时间点实际看到的现象 | "2026 年 9 月实测,知乎全站禁止抓取" | 这四类的共同点是:**AI 可以推理,但无法替你去做。**它们必须来自真实的操作、观察和记录。 务实的用法:AI 起草,人工注入 完全拒绝 AI 不现实,完全交给 AI 也写不出有增量的内容。可执行的组合是: **第一步:用 AI 搭骨架。**让它列出这个主题应该覆盖哪些方面、常见的误解是什么。这一步能省下大量时间。 **第二步:逐节填入自己的东西。**每一节至少要有一处来自你实测、你的环境、或你的失败记录的具体信息。这是文章有没有价值的决定性环节。 **第三步:让 AI 挑毛病,而不是替你下结论。**用它检查逻辑漏洞、术语不一致、表述歧义;不要用它来"把内容说得更漂亮"——那正是同质化的来源。 **第四步:把无法验证的说法删掉。**AI 生成的文字里常有一些听起来合理但没有依据的判断,比如"研究表明大多数站点……"。没有出处就删,别留着。 怎么判断自己的内容有没有信息增量 写完一篇文章,用四个问题自查: 问题 | 不通过的表现 | 有没有具体数字? | 通篇"很多""通常""大部分" | 有没有环境或版本信息? | 读者无法复现你的结论 | 有没有失败记录? | 只讲成功路径,像产品说明书 | 换个人能不能写出一样的内容? | 能,说明没有增量 | 最后一个问题最有效:如果任何人都能写出完全相同的文章,它就不具备被引用的价值。 常见问题(FAQ) 用 AI 生成的内容会被搜索引擎惩罚吗? 主流平台的态度是惩罚低质量内容,而不是惩罚生成方式。判断依据是内容是否对读者有价值、是否提供了独特信息。所以问题不在于"用没用 AI",而在于产出内容是否只是既有信息的重组。 我把 AI 写的内容改一改再发,可以吗? 改措辞不解决问题。同质化的本质是信息相同,不是表达相同——换一套说法,内容对检索系统来说依然是重复的。有效的做法是补充 AI 拿不到的信息,而不是替换表达方式。 完全人工写的内容就一定能被引用吗? 不一定。人工写的内容同样可能同质化——如果只是复述别人已有的观点,处境和 AI 生成内容一样。决定因素是信息增量,不是写作主体。 怎么积累"只有我能写"的素材? 养成两个习惯就够了:做事的时候顺手记下数字和异常,以及把走不通的尝试也记下来。多数人只记录成功的结论,而失败路径、环境细节和具体数字恰好是最稀缺的内容。这些素材积累起来后,写作速度会明显变快,因为可写的东西变多了。 小结 模型不检测"是否 AI 生成",它判断内容的可用性、可靠性与增量。 同质化才是根本障碍:能出现在一万个站点上的内容,被引用的概率极低。 AI 写不出来的四类信息:一手实测、失败路径、环境细节、时间敏感观察。 务实做法是 AI 搭骨架、人工注入一手信息、AI 挑毛病而非代下结论。 最有效的自查问题:换个人能不能写出完全一样的内容? 如果还没弄清 GEO 的整体思路,可以先看 《什么是 GEO》。 如果你在琢磨怎么给自己的内容加上一手信息,欢迎到 留言板聊聊你的领域,也许能一起找出几个可写的角度。 ------------------------------------------------------------------------ ## 博客、公众号、知乎,哪个更容易被 AI 引用 - 原文链接:https://devnotes.cuiyuehui.cn/posts/which-platform-ai-cites-most/ - 发布时间:2026-09-17 - 分类:GEO 入门 - 标签:GEO / AI 搜索 / 抓取 / 渠道 直接回答:内容能不能被 AI 引用,第一道门槛是平台允不允许抓取,而不是内容写得好不好。实测结果是:知乎和微信公众号基本全站禁止爬虫,CSDN、博客园、掘金、简书允许抓取。所以更稳妥的做法是——自有域名当主阵地,平台账号只做分发和引流。 平台之间的差别,先看 robots.txt robots.txt 是站点对爬虫的公开声明,可以直接读到。如果一个平台在文件里写了 Disallow: /,那么无论内容多好,主流爬虫都不会去抓。 以下是 2026 年 9 月 17 日实测的结果: 平台 | robots.txt 策略 | 抓取结论 | 知乎 zhihu.com | 通配组只放行一个路径,其余 Disallow: /;并单独声明 Google-Extended 禁止 | ❌ 基本禁止 | 微信公众号 mp.weixin.qq.com | 通配组仅放行登录页、小程序等少数路径,其余 Disallow: / | ❌ 基本禁止 | CSDN blog.csdn.net | Allow: / | ✅ 允许 | 博客园 cnblogs.com | Allow: /,并声明了 sitemap | ✅ 允许 | 掘金 juejin.cn | 仅屏蔽订阅页与设置页 | ✅ 允许 | 简书 jianshu.com | 仅屏蔽搜索页、私信、笔记 | ✅ 允许 | 这张表解释了一个常见困惑:**为什么在知乎写了很多,AI 却从来没提过你。**不是内容不行,是内容根本没进入可检索的范围。 需要说明的是,平台的策略会调整,上面的结论有明确的时间点。判断方法比结论更重要,可以自己复核: ``` curl -s https://www.zhihu.com/robots.txt | head -20 ``` robots.txt 允许不等于内容一定能被抓到 过了第一道门还有第二道:技术上允许抓取,不代表抓取会成功。 常见的额外阻力: 登录墙:不登录看不到正文,爬虫自然拿不到 频率限制:短时间内请求多了会被降速或拒绝 反爬识别:验证码、JS 挑战、UA 校验 内容异步加载:正文靠前端渲染,抓到的 HTML 是空的 可以用爬虫身份请求一次,看返回的是正文还是验证页: ``` curl -s -o /dev/null -w "%{http_code}\n" \ -A "Mozilla/5.0 (compatible; Googlebot/2.1)" \ https://example.com/some-article/ ``` 返回 200 只是第一步,还要看返回内容里有没有正文,而不是只有"请登录后查看"。 即使都能抓取,可归属性也完全不同 第三个差别更隐蔽,但影响最大:内容能不能明确归属到你。 维度 | 自有域名 | 平台账号 | 作者实体 | 可以完整声明(作者页、结构化数据) | 受平台模板限制 | 地址稳定性 | 完全可控 | 平台改版就可能变 | 内容结构 | 自由组织 | 平台决定排版与切分 | 变更与下线 | 自己说了算 | 平台说了算 | 对 AI 引用来说,**"这是谁写的、在哪个站点"是可信度判断的一部分。**平台内容往往缺少作者实体信息,即使被抓到,模型也更难把它归到某个可靠来源上。 一个务实的组合策略 基于上面三点,建议这样分配精力: **主阵地放在自有域名。**内容首发在自己站点,拥有完整控制权:地址稳定、结构化数据完整、可以在文章里建立主题聚类和内链。 平台账号做分发,不做存档。把文章的核心结论摘出来发平台,引导感兴趣的人回到原站看完整版。这样做有两个好处:平台带来曝光和外部链接,而引用归因落回你自己的域名。 **不要只在一个禁止抓取的平台积累内容。**如果某天想搬到自有域名,你会发现所有历史内容的权重和引用都没法迁移——平台的域名不属于你。 怎么判断一个平台值不值得投入 四个问题,按顺序问: 问题 | 怎么查 | 允许抓取吗 | 读它的 robots.txt | 正文能抓到吗 | 用爬虫 UA 请求一个具体页面 | 内容归属于谁 | 页面能不能标注作者与原始出处 | 地址稳定吗 | 平台是否常用无意义 ID,且历史上有过改版 | 四个都是"是",就值得投入;前两个是"否",写再多也很难被 AI 引用。 常见问题(FAQ) 在知乎写内容完全没有意义吗? 不是。知乎的价值在于读者获取和领域影响力——有人看到、有人讨论、有人因此找到你的站点。它只是不适合作为"被 AI 引用"的载体。把知乎当分发渠道,而不是唯一阵地。 公众号文章为什么很难被 AI 引用? 公众号内容主要被设计为在微信生态内流转,mp.weixin.qq.com 的 robots.txt 对绝大多数路径声明了禁止抓取。也就是说,主流搜索引擎和 AI 爬虫按规则不会抓取这些页面,内容自然不会出现在它们的检索结果里。 自有域名没有流量,写在那里有人看吗? 短期确实不如平台。但 AI 引用依赖的是被抓取、被索引、被归属,这三件事自有域名都占优。更实际的路径是:平台负责让人看到,自有域名负责被长期引用,两边内容有取舍地同步。 平台上的内容可以搬到自己的站点吗? 可以,而且建议做。关键是搬运后在自己的域名上要有独立价值:补充更完整的版本、更新数据、加上内链。如果只是复制粘贴,两处内容高度重复,反而会分散权重。 小结 平台能不能被引用,第一道门槛是 robots.txt,不是内容质量。 实测:知乎与公众号基本禁止抓取,CSDN、博客园、掘金、简书允许。 robots.txt 允许只是及格线,登录墙、反爬、异步渲染仍会拦住抓取。 自有域名在作者实体、地址稳定性、内容结构上都有明显优势。 务实策略:自有域名做阵地,平台做分发,不要只押注在禁止抓取的平台上。 如果你在纠结内容该放在哪个平台,欢迎到 留言板说说你的场景,可以一起判断值不值得投入。 平台选定之后,中文内容在检索环节的额外差异见 《中文内容在 AI 搜索里的表现比英文差吗》。 ------------------------------------------------------------------------ ## 站点改版后 URL 变了,怎么保住已有的引用 - 原文链接:https://devnotes.cuiyuehui.cn/posts/url-change-keep-ai-citations/ - 发布时间:2026-09-17 - 分类:建站与部署 - 标签:GEO / Nginx / URL 迁移 / 301 直接回答:URL 变更不会让引用立刻消失,伤害是滞后的——模型和索引里存的还是旧地址,等它们重新抓取时才发现内容已经不在了。保住引用只需要三件事:每一条旧地址都有 301 指向新地址、跳转链不超过一跳、sitemap 与站内链接同步更新并保留至少一年。 伤害是滞后的,所以最容易误判 改完 URL 的当天,你去看 AI 搜索,往往会发现引用还在——因为索引里存的还是旧地址。真正的下滑出现在之后的两到六周,那时爬虫重新访问旧地址,发现是 404,才把记录清掉。 这种滞后带来一个典型误判:改完没出问题,就以为不用管了,等发现问题时已经过去一个月,旧地址的外部链接和引用记录都失效了。 所以判断标准很简单:改 URL 之后,旧地址必须永远有效,只是把用户和爬虫送到新地方。 301 是唯一正确的迁移手段 几种常见做法的差别: 做法 | 效果 | 301 永久跳转 | ✅ 传递权重与引用,标准做法 | 302 临时跳转 | ⚠️ 短期可用,长期会被当作临时状态 | 直接返回 404 | ❌ 引用与权重丢失 | 新旧地址都返回 200 同一内容 | ❌ 重复内容,两个地址互相稀释 | 用 JavaScript 跳转 | ❌ 抓取阶段经常执行不到 | **只有 301 是明确告诉对方"这个地址永久搬走了"的信号。**其他方式要么不传递权重,要么在抓取环节就直接断掉。 第五种情况值得单独说:把新旧两个地址都保留、都返回 200,看起来"两边都能访问",实际是让两个地址争夺同一份内容,最终两个都受损。 旧地址映射要写进配置文件,长期保留 在 nginx 里做逐条映射是最直接的方式: ``` # 旧文章地址 → 新地址 location = /old-post-title.html { return 301 /posts/new-post-title/; } # 整段路径迁移 location ^~ /blog/ { return 301 /posts/$1; } # 分类页结构变化 location = /category/geo/ { return 301 /categories/geo/; } ``` 地址多的时候,用 map 集中管理更清晰: ``` map $request_uri $redirect_target { default ""; /old-a/ /posts/a/; /old-b/ /posts/b/; /old-c/ /posts/c/; } server { if ($redirect_target != "") { return 301 $redirect_target; } } ``` 几个要点: 用 location = 做精确匹配,避免规则互相干扰 映射表放在配置文件里,不要放在数据库或脚本里——它需要长期存在 改完必须实际请求一遍旧地址,看返回的 Location 是否正确 跳转链必须控制在一次以内 A → B → C 这种多级跳转是常见的隐性损耗:每多一跳,抓取预算和权重传递都会被削弱,部分爬虫在第二跳就放弃了。 自查方法: ``` curl -sI https://example.com/old-url/ | grep -iE "^(HTTP|location)" ``` 如果返回的 Location 指向的地址还会再跳一次,就把映射直接改成指向最终地址,把中间那一环删掉。 内部改写会让跳转规则陷入死循环 本站做过一次地址规范化:把 /topic/index.html 这类带文件名的地址统一跳到目录形式 /topic/。第一版配置是这样写的: ``` # ❌ 有问题的写法 location ~ ^(? /.*)/index\.html$ { return 301 $dir/; } ``` 上线后除首页外全站瘫痪——访问 /topic/ 会无限跳转。 原因是 nginx 在处理目录请求时,会在内部把 /topic/ 改写成 /topic/index.html,改写后的地址又匹配了这条 location 规则,于是 /topic/ 被要求跳到 /topic/,形成死循环。 正确的做法是判断客户端原始请求,而不是内部改写后的地址: ``` # ✅ 正确写法 if ($request_uri ~ ^(/(?:[^?]*/)?)index\.html(?:\?|$)) { return 301 $1; } ``` $request_uri 保存的是浏览器实际请求的地址,不受内部改写影响,因此不会自我循环。 这个坑靠本地静态预览完全看不出来——静态服务器没有内部改写行为。涉及跳转规则时,一定要在真实 nginx 环境(哪怕是临时实例)验证,而不是只在本地看页面能不能打开。 迁移完成后有四件事必须做 动作 | 原因 | 重新生成并提交 sitemap.xml | 让爬虫尽快发现新地址 | 更新站内所有指向旧地址的链接 | 内链走旧地址会持续产生跳转 | 检查 robots.txt 里的地址是否过期 | 站点地图声明指向旧文件会失效 | 保留 301 至少一年 | 外部链接与索引的更新周期可能很长 | 另外注意:**已经发布过的地址尽量不要再改。**迁移本身是有成本的,规划阶段多想一步,比事后修补省事得多。 常见问题(FAQ) 换了域名,旧域名的 301 要保留多久? 建议长期保留,至少一年,有条件就一直保留。旧域名的外部链接不会因为你换了域名就消失,只要旧域名还在解析,就应该继续把访问者送到新站。域名到期前记得续费——域名过期是唯一无法用 301 挽回的情况。 用 JavaScript 跳转能替代 301 吗? 不能。搜索引擎和 AI 爬虫在抓取阶段经常不执行 JavaScript,看到的是一个内容为空的页面;即使执行了,权重传递效果也远不如 301。JS 跳转只适合作为辅助手段,不能作为迁移方案。 只改文件名不改目录结构,也需要 301 吗? 需要。任何已发布地址的变化都算迁移,哪怕只是去掉了结尾的 .html。判断标准是"这个地址之前有没有对外出现过",而不是"改动大不大"。 迁移后引用掉了,还能恢复吗? 如果旧地址返回 301 并且新地址内容一致,引用通常会随着重新抓取逐步恢复,周期几周到几个月。如果旧地址返回 404,或者新地址内容被大改,恢复就很困难——这也说明迁移时要尽量保持内容主体不变。 小结 URL 变更的伤害滞后 2–6 周出现,别因为当天没问题就放心。 每一条旧地址都要有 301,跳转链控制在一跳以内。 新旧地址同时返回 200 是收益最差的做法。 nginx 里判断跳转要看 $request_uri,否则可能被内部改写拖进死循环。 迁移后同步更新 sitemap、内链与 robots.txt,并把 301 保留一年以上。 迁移只是 GEO 工作里的一环,整体思路见 《什么是 GEO》。 如果你正在做站点迁移,拿不准某条跳转规则会不会出问题,欢迎到 留言板贴出配置,一起看看。 ------------------------------------------------------------------------ ## 结构化数据加了但没效果?先检查这四处 - 原文链接:https://devnotes.cuiyuehui.cn/posts/structured-data-not-working/ - 发布时间:2026-09-17 - 分类:GEO 工具箱 - 标签:GEO / 排查 / 结构化数据 / JSON-LD 直接回答:结构化数据加了没效果,绝大多数情况不是类型选错,而是四个基础问题之一——页面根本没被索引、JSON-LD 格式让解析器读不到、地址用的是示例域名、数据与页面可见内容对不上。这四项按顺序查一遍,比研究 Schema.org 的细节有用得多。 结构化数据不负责"被收录",先确认页面能被抓到 一个前提要先说清楚:结构化数据的作用是把页面里已经存在的信息表达得更明确,它不会让一个没被收录的页面变得可检索。 所以排查的第一步不是看代码,而是确认: 页面能被爬虫抓取(返回 200,没有被 robots.txt 或 CDN 拦) 页面已经进入索引(搜 site:域名 能找到) 内容本身回答了某个真实问题 **这三条不成立时,结构化数据写得再标准也没有意义。**前两条的验证方法见 《为什么 AI 从来不提我的网站》。 检查点一:格式错误的 JSON-LD 会被静默忽略 格式错误的 JSON-LD 会被解析器直接忽略,而且不会在页面上显示任何异常——这是最容易被漏掉的一类问题。 常见错误: ``` { "@context": "https://schema.org", "@type": "BlogPosting" }} {"@type": "BlogPosting"} ``` 第二种情况在静态站点生成器里很常见:模板引擎对字符串做了 HTML 转义,结果 " 变成了 ",JSON 直接失效。 验证方式:直接查看页面源码,把