直接回答:内容能不能被 AI 引用,第一道门槛是平台允不允许抓取,而不是内容写得好不好。实测结果是:知乎和微信公众号基本全站禁止爬虫,CSDN、博客园、掘金、简书允许抓取。所以更稳妥的做法是——自有域名当主阵地,平台账号只做分发和引流。
平台之间的差别,先看 robots.txt
robots.txt 是站点对爬虫的公开声明,可以直接读到。如果一个平台在文件里写了 Disallow: /,那么无论内容多好,主流爬虫都不会去抓。
以下是 2026 年 9 月 17 日实测的结果:
| 平台 | robots.txt 策略 | 抓取结论 |
|---|---|---|
知乎 zhihu.com |
通配组只放行一个路径,其余 Disallow: /;并单独声明 Google-Extended 禁止 |
❌ 基本禁止 |
微信公众号 mp.weixin.qq.com |
通配组仅放行登录页、小程序等少数路径,其余 Disallow: / |
❌ 基本禁止 |
CSDN blog.csdn.net |
Allow: / |
✅ 允许 |
博客园 cnblogs.com |
Allow: /,并声明了 sitemap |
✅ 允许 |
掘金 juejin.cn |
仅屏蔽订阅页与设置页 | ✅ 允许 |
简书 jianshu.com |
仅屏蔽搜索页、私信、笔记 | ✅ 允许 |
这张表解释了一个常见困惑:**为什么在知乎写了很多,AI 却从来没提过你。**不是内容不行,是内容根本没进入可检索的范围。
需要说明的是,平台的策略会调整,上面的结论有明确的时间点。判断方法比结论更重要,可以自己复核:
1 | curl -s https://www.zhihu.com/robots.txt | head -20 |
robots.txt 允许不等于内容一定能被抓到
过了第一道门还有第二道:技术上允许抓取,不代表抓取会成功。
常见的额外阻力:
- 登录墙:不登录看不到正文,爬虫自然拿不到
- 频率限制:短时间内请求多了会被降速或拒绝
- 反爬识别:验证码、JS 挑战、UA 校验
- 内容异步加载:正文靠前端渲染,抓到的 HTML 是空的
可以用爬虫身份请求一次,看返回的是正文还是验证页:
1 | curl -s -o /dev/null -w "%{http_code}\n" \ |
返回 200 只是第一步,还要看返回内容里有没有正文,而不是只有"请登录后查看"。
即使都能抓取,可归属性也完全不同
第三个差别更隐蔽,但影响最大:内容能不能明确归属到你。
| 维度 | 自有域名 | 平台账号 |
|---|---|---|
| 作者实体 | 可以完整声明(作者页、结构化数据) | 受平台模板限制 |
| 地址稳定性 | 完全可控 | 平台改版就可能变 |
| 内容结构 | 自由组织 | 平台决定排版与切分 |
| 变更与下线 | 自己说了算 | 平台说了算 |
对 AI 引用来说,**"这是谁写的、在哪个站点"是可信度判断的一部分。**平台内容往往缺少作者实体信息,即使被抓到,模型也更难把它归到某个可靠来源上。
一个务实的组合策略
基于上面三点,建议这样分配精力:
**主阵地放在自有域名。**内容首发在自己站点,拥有完整控制权:地址稳定、结构化数据完整、可以在文章里建立主题聚类和内链。
平台账号做分发,不做存档。把文章的核心结论摘出来发平台,引导感兴趣的人回到原站看完整版。这样做有两个好处:平台带来曝光和外部链接,而引用归因落回你自己的域名。
**不要只在一个禁止抓取的平台积累内容。**如果某天想搬到自有域名,你会发现所有历史内容的权重和引用都没法迁移——平台的域名不属于你。
怎么判断一个平台值不值得投入
四个问题,按顺序问:
| 问题 | 怎么查 |
|---|---|
| 允许抓取吗 | 读它的 robots.txt |
| 正文能抓到吗 | 用爬虫 UA 请求一个具体页面 |
| 内容归属于谁 | 页面能不能标注作者与原始出处 |
| 地址稳定吗 | 平台是否常用无意义 ID,且历史上有过改版 |
四个都是"是",就值得投入;前两个是"否",写再多也很难被 AI 引用。
常见问题(FAQ)
在知乎写内容完全没有意义吗?
不是。知乎的价值在于读者获取和领域影响力——有人看到、有人讨论、有人因此找到你的站点。它只是不适合作为"被 AI 引用"的载体。把知乎当分发渠道,而不是唯一阵地。
公众号文章为什么很难被 AI 引用?
公众号内容主要被设计为在微信生态内流转,mp.weixin.qq.com 的 robots.txt 对绝大多数路径声明了禁止抓取。也就是说,主流搜索引擎和 AI 爬虫按规则不会抓取这些页面,内容自然不会出现在它们的检索结果里。
自有域名没有流量,写在那里有人看吗?
短期确实不如平台。但 AI 引用依赖的是被抓取、被索引、被归属,这三件事自有域名都占优。更实际的路径是:平台负责让人看到,自有域名负责被长期引用,两边内容有取舍地同步。
平台上的内容可以搬到自己的站点吗?
可以,而且建议做。关键是搬运后在自己的域名上要有独立价值:补充更完整的版本、更新数据、加上内链。如果只是复制粘贴,两处内容高度重复,反而会分散权重。
小结
- 平台能不能被引用,第一道门槛是
robots.txt,不是内容质量。 - 实测:知乎与公众号基本禁止抓取,CSDN、博客园、掘金、简书允许。
robots.txt允许只是及格线,登录墙、反爬、异步渲染仍会拦住抓取。- 自有域名在作者实体、地址稳定性、内容结构上都有明显优势。
- 务实策略:自有域名做阵地,平台做分发,不要只押注在禁止抓取的平台上。
如果你在纠结内容该放在哪个平台,欢迎到留言板说说你的场景,可以一起判断值不值得投入。
平台选定之后,中文内容在检索环节的额外差异见《中文内容在 AI 搜索里的表现比英文差吗》。