直接回答:内容能不能被 AI 引用,第一道门槛是平台允不允许抓取,而不是内容写得好不好。实测结果是:知乎和微信公众号基本全站禁止爬虫,CSDN、博客园、掘金、简书允许抓取。所以更稳妥的做法是——自有域名当主阵地,平台账号只做分发和引流。

平台之间的差别,先看 robots.txt

robots.txt 是站点对爬虫的公开声明,可以直接读到。如果一个平台在文件里写了 Disallow: /,那么无论内容多好,主流爬虫都不会去抓。

以下是 2026 年 9 月 17 日实测的结果:

平台 robots.txt 策略 抓取结论
知乎 zhihu.com 通配组只放行一个路径,其余 Disallow: /;并单独声明 Google-Extended 禁止 ❌ 基本禁止
微信公众号 mp.weixin.qq.com 通配组仅放行登录页、小程序等少数路径,其余 Disallow: / ❌ 基本禁止
CSDN blog.csdn.net Allow: / ✅ 允许
博客园 cnblogs.com Allow: /,并声明了 sitemap ✅ 允许
掘金 juejin.cn 仅屏蔽订阅页与设置页 ✅ 允许
简书 jianshu.com 仅屏蔽搜索页、私信、笔记 ✅ 允许

这张表解释了一个常见困惑:**为什么在知乎写了很多,AI 却从来没提过你。**不是内容不行,是内容根本没进入可检索的范围。

需要说明的是,平台的策略会调整,上面的结论有明确的时间点。判断方法比结论更重要,可以自己复核:

1
curl -s https://www.zhihu.com/robots.txt | head -20

robots.txt 允许不等于内容一定能被抓到

过了第一道门还有第二道:技术上允许抓取,不代表抓取会成功。

常见的额外阻力:

  • 登录墙:不登录看不到正文,爬虫自然拿不到
  • 频率限制:短时间内请求多了会被降速或拒绝
  • 反爬识别:验证码、JS 挑战、UA 校验
  • 内容异步加载:正文靠前端渲染,抓到的 HTML 是空的

可以用爬虫身份请求一次,看返回的是正文还是验证页:

1
2
3
curl -s -o /dev/null -w "%{http_code}\n" \
-A "Mozilla/5.0 (compatible; Googlebot/2.1)" \
https://example.com/some-article/

返回 200 只是第一步,还要看返回内容里有没有正文,而不是只有"请登录后查看"。

即使都能抓取,可归属性也完全不同

第三个差别更隐蔽,但影响最大:内容能不能明确归属到你。

维度 自有域名 平台账号
作者实体 可以完整声明(作者页、结构化数据) 受平台模板限制
地址稳定性 完全可控 平台改版就可能变
内容结构 自由组织 平台决定排版与切分
变更与下线 自己说了算 平台说了算

对 AI 引用来说,**"这是谁写的、在哪个站点"是可信度判断的一部分。**平台内容往往缺少作者实体信息,即使被抓到,模型也更难把它归到某个可靠来源上。

一个务实的组合策略

基于上面三点,建议这样分配精力:

**主阵地放在自有域名。**内容首发在自己站点,拥有完整控制权:地址稳定、结构化数据完整、可以在文章里建立主题聚类和内链。

平台账号做分发,不做存档。把文章的核心结论摘出来发平台,引导感兴趣的人回到原站看完整版。这样做有两个好处:平台带来曝光和外部链接,而引用归因落回你自己的域名

**不要只在一个禁止抓取的平台积累内容。**如果某天想搬到自有域名,你会发现所有历史内容的权重和引用都没法迁移——平台的域名不属于你。

怎么判断一个平台值不值得投入

四个问题,按顺序问:

问题 怎么查
允许抓取吗 读它的 robots.txt
正文能抓到吗 用爬虫 UA 请求一个具体页面
内容归属于谁 页面能不能标注作者与原始出处
地址稳定吗 平台是否常用无意义 ID,且历史上有过改版

四个都是"是",就值得投入;前两个是"否",写再多也很难被 AI 引用。

常见问题(FAQ)

在知乎写内容完全没有意义吗?

不是。知乎的价值在于读者获取和领域影响力——有人看到、有人讨论、有人因此找到你的站点。它只是不适合作为"被 AI 引用"的载体。把知乎当分发渠道,而不是唯一阵地。

公众号文章为什么很难被 AI 引用?

公众号内容主要被设计为在微信生态内流转,mp.weixin.qq.comrobots.txt 对绝大多数路径声明了禁止抓取。也就是说,主流搜索引擎和 AI 爬虫按规则不会抓取这些页面,内容自然不会出现在它们的检索结果里。

自有域名没有流量,写在那里有人看吗?

短期确实不如平台。但 AI 引用依赖的是被抓取、被索引、被归属,这三件事自有域名都占优。更实际的路径是:平台负责让人看到,自有域名负责被长期引用,两边内容有取舍地同步。

平台上的内容可以搬到自己的站点吗?

可以,而且建议做。关键是搬运后在自己的域名上要有独立价值:补充更完整的版本、更新数据、加上内链。如果只是复制粘贴,两处内容高度重复,反而会分散权重。

小结

  • 平台能不能被引用,第一道门槛是 robots.txt,不是内容质量。
  • 实测:知乎与公众号基本禁止抓取,CSDN、博客园、掘金、简书允许。
  • robots.txt 允许只是及格线,登录墙、反爬、异步渲染仍会拦住抓取。
  • 自有域名在作者实体、地址稳定性、内容结构上都有明显优势。
  • 务实策略:自有域名做阵地,平台做分发,不要只押注在禁止抓取的平台上。

如果你在纠结内容该放在哪个平台,欢迎到留言板说说你的场景,可以一起判断值不值得投入。

平台选定之后,中文内容在检索环节的额外差异见《中文内容在 AI 搜索里的表现比英文差吗》

站内搜索

没有找到内容!