KEEL · 龙骨 · A CURRICULUM FOR THE AI ERA

11 · AI 搜索与 LLM 抓取:新变量 — keel 龙骨

本章目标:把 AI 搜索与 LLM 抓取当成一个需要观测、区分、决策的新变量来对待,而不是跟风。 验收标准:能识别 AI 爬虫 UA、量化其抓取、对 llms.txt 等新做法做出有依据的取舍。

本章目标:把 AI 搜索与 LLM 抓取当成一个需要观测、区分、决策的新变量来对待,而不是跟风。
验收标准:能识别 AI 爬虫 UA、量化其抓取、对 llms.txt 等新做法做出有依据的取舍。

为什么单列一章:AI 摘要正在成为新的内容分发入口,"被生成式答案引用"与"被用户点击"是两件事。这里规则尚未稳定,因此本章的立场是:先把事实与推断分开,再用数据决策,而不是盲从潮流。


一、AI 相关爬虫的分类

先分清三类,它们的用途完全不同:

类别 代表 UA 用途 放行立场
训练/数据集 GPTBot、ClaudeBot、Google-Extended 抓取语料用于训练 可自行选择
搜索/索引 OAI-SearchBot、PerplexityBot、Applebot 支撑实时搜索答案 通常建议放行
用户触发 ChatGPT-User、Claude-User 用户请求时实时抓取 通常建议放行

关键区分:

# 只拒绝训练,放行搜索与用户触发
User-agent: Google-Extended
Disallow: /

User-agent: GPTBot
Disallow: /

# 搜索与用户触发放行(不写即放行)
User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

二、识别与量化 AI 爬虫

和传统爬虫一样,AI 爬虫也带 UA,但同样可伪造,需用双向 DNS 或其他方式校验(可信来源通常公布 IP 段)。

# 日志里 AI 爬虫的抓取量(假设已解析为 TSV 事实表)
sqlite3 /tmp/seo.db "SELECT bot, count(*) n FROM crawl
  WHERE bot IN ('gptbot','claudebot','perplexitybot')
  GROUP BY bot ORDER BY n DESC;"

# 原始日志版本
grep -oiE 'GPTBot|ClaudeBot|PerplexityBot|OAI-SearchBot|ChatGPT-User|Google-Extended' \
  /var/log/nginx/learning.access.log | sort | uniq -c | sort -rn

要点:AI 爬虫的抓取量往往远小于传统爬虫,但增长趋势才是信号。把它纳入第 02 章的事实表,长期观察。


三、llms.txt:实际效力与争议

llms.txt 是一种提议中的约定——在站点根目录放一个 Markdown 文件,列出内容入口,方便 LLM 消费。

https://www.xxxxxx.cn/llms.txt
# 示例学习站

## 内容入口
- 课程总览: https://www.xxxxxx.cn/
- SEO 基础: https://www.xxxxxx.cn/courses/seo-fundamentals

必须诚实说明的现状:

说法 事实
"llms.txt 是 AI 搜索的标准" ❌ 它只是社区提议,不是 W3C/主流引擎的正式标准
"没有它就不会被 AI 引用" ❌ 无证据表明主流 AI 索引依赖它
"加了一定有用" ⚠️ 尚无公认验证;低成本可加,但不要指望
"它替代 sitemap" ❌ 不替代。sitemap 服务于传统搜索引擎,有实际效果

建议立场:


四、"被引用"与"被点击"的区别

这是 AI 搜索时代最重要的认知差:

维度 传统搜索 AI 搜索/摘要
用户路径 看到蓝色链接 → 点击 看到生成的答案 → 可能不点
你的收益 流量 可能是曝光/品牌而非点击
度量 点击、会话 引用次数(难度量)、品牌搜索
优化目标 排名 + 点击率 成为答案的来源/论据

实践含义:

  1. 不要用点击衡量 AI 搜索的全部价值——被引用带来的品牌与信任,可能不以点击形式体现。
  2. 争取成为答案来源:结构清晰、有明确定义、有可核查事实的内容更容易被引用。
  3. 关注品牌词搜索量:AI 引用可能转化为"直接搜你的品牌",这是可观测的间接信号。
# 观察品牌词自然搜索(GSC)与直接访问是否在 AI 引用后上升
# 在 GSC 中筛选品牌词,观察趋势(人工)

五、决策框架:面对新变量的取舍

面对任何"AI SEO 新做法",用这张表决策:

问题 判断
有官方或权威来源确认吗? 无 → 归为实验
实施成本高吗? 高 → 谨慎,先小范围验证
有可度量的效果吗? 无 → 不做为主策略
会伤害既有基础吗? 会 → 坚决不做
可回滚吗? 不可 → 不做

底线:任何 AI 相关的新做法,都不能以牺牲抓取、索引、内容质量为代价。


六、故障速查

现象 原因 处理
屏蔽 Google-Extended 后搜索掉量 误以为它管搜索 恢复;它不管搜索
屏蔽 ChatGPT-User 后用户报错 把用户触发当训练爬虫 放行用户触发类
加了 llms.txt 无任何变化 正常,无强保证 当实验,继续观察
AI 爬虫 UA 来源可疑 UA 伪造 用 IP/双向 DNS 校验
有 AI 引用但无流量 引用≠点击 改用品牌/引用口径衡量

七、本章验收

# 本章核心:AI 爬虫观测
grep -oiE 'GPTBot|ClaudeBot|PerplexityBot|OAI-SearchBot|ChatGPT-User|Google-Extended' \
  /var/log/nginx/learning.access.log | sort | uniq -c | sort -rn

新变量处理完,最后一章把所有能力收拢成一套可长期运行的治理框架。

进入 keel 阅读