直接回答:AI 收录监测的可行做法只有一条——用固定问题集在多个平台定期采样,解析答案中的引用与提及,再做趋势分析。难点不在调用接口,而在问题集设计、判定规则和长期一致性。
为什么这件事必须自己建
搜索引擎有 Search Console 这类工具告诉你"被展示了多少次、被点击了多少次"。AI 搜索目前没有等价物。
这意味着两件事:
- 你无法直接知道自己的内容有没有进过 AI 的答案。
- 唯一的办法是站到用户的位置去提问,然后看模型回答里有没有你。
这本质上是抽样统计。抽样就要接受误差,所以设计上必须保证:样本固定、周期固定、判定规则固定。
监测链路
1 | 问题集(固定 20-50 条) |
一、问题集怎么设计
问题集是整个监测系统的基准,改一次就要重新累计趋势,所以要慎重。
三类问题配比
| 类型 | 占比 | 例子 | 作用 |
|---|---|---|---|
| 品牌类 | 20% | "DevNotes 是什么" | 检验品牌认知 |
| 主题类 | 50% | "GEO 和 SEO 有什么区别" | 检验内容引用 |
| 长尾类 | 30% | "小站怎么让 AI 引用自己的文章" | 检验细分覆盖 |
写作要求
- 用完整自然语言问句,模拟真实提问,而不是关键词堆叠。
- 一个问题只问一件事,避免"GEO 是什么、怎么做、多久见效"这种复合问题。
- 至少保留 5 个长期不变的问题,作为跨年的基线。
二、任务调度
调度层要解决三件事:别把平台的额度打爆、别被限流、失败要能重试。
1 | # 伪代码:多平台采样调度 |
几个实际参数:
| 参数 | 取值 | 说明 |
|---|---|---|
| 单平台并发 | 1-2 | 避免触发限流 |
| 单次超时 | 90 秒 | 联网检索通常比纯生成慢 |
| 失败重试 | 2 次,间隔 30s | 超过则记录为"未采样",不等于"未引用" |
| 调度周期 | 双周 | 频率与人工检查节奏匹配 |
"未采样"和"未引用"必须分开记录。 早期版本我把超时直接算作未引用,导致趋势图上出现大量虚假下跌。
三、引用判定
这是整套系统里最容易做错的部分。判定分成三级:
| 级别 | 判定方式 | 置信度 |
|---|---|---|
| 强引用 | 答案的来源列表里出现目标域名 | 高 |
| 弱引用 | 答案正文提到品牌名或文章标题,但无链接 | 中 |
| 无 | 两者都没有 | — |
判定规则要处理几种边界情况:
1 | ① 域名匹配要区分主域与子域 → 用 eTLD+1 比较,避免误判 |
抽检机制
再好的自动规则也会有误差。我的做法是每次采样后人工抽检 10%:如果抽检发现误判率超过 5%,就调整规则并重新计算历史数据。
四、趋势看板
看板只放几个真正会用来做决策的指标,避免变成一个没人看的仪表盘:
| 指标 | 定义 | 用途 |
|---|---|---|
| 引用率 | 强引用次数 / 有效采样次数 | 判断整体可见性 |
| 提及率 | (强引用 + 弱引用)/ 有效采样次数 | 判断品牌认知 |
| 平台覆盖数 | 至少被引用过一次的平台数量 | 判断投放广度 |
| 新增被引用页面 | 本次新出现的被引用 URL | 指导后续内容方向 |
| 失守页面 | 上次被引用、本次不再出现 | 提示内容需要更新 |
"失守页面"这个指标特别有用。 它通常意味着对应内容已经不够新,或者被更完整的竞品内容替代了,是最直接的更新信号。
实测成本与准确率
跑了一个季度的实际数据:
| 项目 | 数值 |
|---|---|
| 问题数 × 平台数 | 50 × 5 |
| 单次采样查询数 | 250 |
| 单次采样耗时 | 约 18 分钟 |
| 单次 API 成本 | 十几元 |
| 全年成本 | 三百元以内 |
| 强引用判定准确率 | 约 96%(人工抽检 200 条) |
| 弱引用判定准确率 | 约 88% |
准确率的关键在于承认不确定性。 报告里我始终同时给出采样量和置信提示,而不是把抽样结果包装成精确数字。
这份数据接下来怎么用
监测本身不产生价值,由监测驱动的动作才产生价值:
- 某个问题从没被引用 → 说明缺少对应内容,补一篇。
- 某篇文章被引用但内容过时 → 更新,并修改
dateModified。 - 某个平台完全没引用 → 检查该平台更偏好什么类型的内容。
- 竞品被引用而你没有 → 对比它在同一问题下的内容结构。
常见问题(FAQ)
为什么不能用接口直接拿到引用数据?
因为主流 AI 搜索产品都没有面向第三方的引用统计接口。要判断某篇文章是否被引用,只能主动提交问题、解析返回的答案与来源列表。这套方法本质上是抽样统计,所以在报告里必须同时给出采样量和置信区间。
采样成本大概是多少?
以 50 个问题、5 个平台、每两周一次为例,单次采样约 250 次查询。如果用带联网检索的 API,单次成本在几元到几十元量级,一年下来通常在几百元以内,远低于人工检查的时间成本。
引用判定怎么做得更准?
分三步:先用域名匹配判断是否指向目标站点,再用标题和关键句相似度确认引用的是哪一篇,最后人工抽检 10% 的结果修正规则。纯域名匹配会漏掉品牌提及,纯文本匹配会误判。
专栏小结
三篇文章覆盖了自建 GEO 平台的完整路径:
如果你自己也在做收录监测,欢迎到留言板聊聊你的判定规则——"什么算被引用"这件事目前没有标准答案,多几个样本会更有意思。