KEEL · 龙骨 · A CURRICULUM FOR THE AI ERA
11 · AI 搜索与 LLM 抓取:新变量 — keel 龙骨
本章目标:把 AI 搜索与 LLM 抓取当成一个需要观测、区分、决策的新变量来对待,而不是跟风。 验收标准:能识别 AI 爬虫 UA、量化其抓取、对 llms.txt 等新做法做出有依据的取舍。
本章目标:把 AI 搜索与 LLM 抓取当成一个需要观测、区分、决策的新变量来对待,而不是跟风。
验收标准:能识别 AI 爬虫 UA、量化其抓取、对 llms.txt 等新做法做出有依据的取舍。
为什么单列一章:AI 摘要正在成为新的内容分发入口,"被生成式答案引用"与"被用户点击"是两件事。这里规则尚未稳定,因此本章的立场是:先把事实与推断分开,再用数据决策,而不是盲从潮流。
一、AI 相关爬虫的分类
先分清三类,它们的用途完全不同:
| 类别 | 代表 UA | 用途 | 放行立场 |
|---|---|---|---|
| 训练/数据集 | GPTBot、ClaudeBot、Google-Extended |
抓取语料用于训练 | 可自行选择 |
| 搜索/索引 | OAI-SearchBot、PerplexityBot、Applebot |
支撑实时搜索答案 | 通常建议放行 |
| 用户触发 | ChatGPT-User、Claude-User |
用户请求时实时抓取 | 通常建议放行 |
关键区分:
Google-Extended不控制 Google 搜索,它只影响 Google 的 AI 训练/某些生成能力。屏蔽它不会让你掉出 Google 搜索。GPTBot是训练爬虫;如果你希望内容出现在 ChatGPT 搜索里,相关的通常是OAI-SearchBot。ChatGPT-User是用户触发,屏蔽它等于用户让你抓、你拒绝,体验上像"打不开"。
# 只拒绝训练,放行搜索与用户触发
User-agent: Google-Extended
Disallow: /
User-agent: GPTBot
Disallow: /
# 搜索与用户触发放行(不写即放行)
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
二、识别与量化 AI 爬虫
和传统爬虫一样,AI 爬虫也带 UA,但同样可伪造,需用双向 DNS 或其他方式校验(可信来源通常公布 IP 段)。
# 日志里 AI 爬虫的抓取量(假设已解析为 TSV 事实表)
sqlite3 /tmp/seo.db "SELECT bot, count(*) n FROM crawl
WHERE bot IN ('gptbot','claudebot','perplexitybot')
GROUP BY bot ORDER BY n DESC;"
# 原始日志版本
grep -oiE 'GPTBot|ClaudeBot|PerplexityBot|OAI-SearchBot|ChatGPT-User|Google-Extended' \
/var/log/nginx/learning.access.log | sort | uniq -c | sort -rn
要点:AI 爬虫的抓取量往往远小于传统爬虫,但增长趋势才是信号。把它纳入第 02 章的事实表,长期观察。
三、llms.txt:实际效力与争议
llms.txt 是一种提议中的约定——在站点根目录放一个 Markdown 文件,列出内容入口,方便 LLM 消费。
https://www.xxxxxx.cn/llms.txt
# 示例学习站
## 内容入口
- 课程总览: https://www.xxxxxx.cn/
- SEO 基础: https://www.xxxxxx.cn/courses/seo-fundamentals
必须诚实说明的现状:
| 说法 | 事实 |
|---|---|
| "llms.txt 是 AI 搜索的标准" | ❌ 它只是社区提议,不是 W3C/主流引擎的正式标准 |
| "没有它就不会被 AI 引用" | ❌ 无证据表明主流 AI 索引依赖它 |
| "加了一定有用" | ⚠️ 尚无公认验证;低成本可加,但不要指望 |
| "它替代 sitemap" | ❌ 不替代。sitemap 服务于传统搜索引擎,有实际效果 |
建议立场:
- 成本极低、无害,可以顺手加(本站的构建脚本就会生成
llms.txt)。 - 不要把它当策略核心,也不要为它牺牲 sitemap、结构化数据这些有实证的做法。
- 把它当实验:加了之后,观察 AI 爬虫抓取与引用是否有变化,用数据说话。
四、"被引用"与"被点击"的区别
这是 AI 搜索时代最重要的认知差:
| 维度 | 传统搜索 | AI 搜索/摘要 |
|---|---|---|
| 用户路径 | 看到蓝色链接 → 点击 | 看到生成的答案 → 可能不点 |
| 你的收益 | 流量 | 可能是曝光/品牌而非点击 |
| 度量 | 点击、会话 | 引用次数(难度量)、品牌搜索 |
| 优化目标 | 排名 + 点击率 | 成为答案的来源/论据 |
实践含义:
- 不要用点击衡量 AI 搜索的全部价值——被引用带来的品牌与信任,可能不以点击形式体现。
- 争取成为答案来源:结构清晰、有明确定义、有可核查事实的内容更容易被引用。
- 关注品牌词搜索量:AI 引用可能转化为"直接搜你的品牌",这是可观测的间接信号。
# 观察品牌词自然搜索(GSC)与直接访问是否在 AI 引用后上升
# 在 GSC 中筛选品牌词,观察趋势(人工)
五、决策框架:面对新变量的取舍
面对任何"AI SEO 新做法",用这张表决策:
| 问题 | 判断 |
|---|---|
| 有官方或权威来源确认吗? | 无 → 归为实验 |
| 实施成本高吗? | 高 → 谨慎,先小范围验证 |
| 有可度量的效果吗? | 无 → 不做为主策略 |
| 会伤害既有基础吗? | 会 → 坚决不做 |
| 可回滚吗? | 不可 → 不做 |
底线:任何 AI 相关的新做法,都不能以牺牲抓取、索引、内容质量为代价。
六、故障速查
| 现象 | 原因 | 处理 |
|---|---|---|
| 屏蔽 Google-Extended 后搜索掉量 | 误以为它管搜索 | 恢复;它不管搜索 |
| 屏蔽 ChatGPT-User 后用户报错 | 把用户触发当训练爬虫 | 放行用户触发类 |
| 加了 llms.txt 无任何变化 | 正常,无强保证 | 当实验,继续观察 |
| AI 爬虫 UA 来源可疑 | UA 伪造 | 用 IP/双向 DNS 校验 |
| 有 AI 引用但无流量 | 引用≠点击 | 改用品牌/引用口径衡量 |
七、本章验收
- 能区分训练/搜索/用户触发三类 AI 爬虫及其 robots 策略
- 日志事实表已纳入 AI 爬虫并可持续观察
- 对 llms.txt 的效力有基于事实的判断(实验而非核心策略)
- 理解"被引用"与"被点击"的区别,并选好度量口径
- 对新做法有一套决策框架,不盲从
# 本章核心:AI 爬虫观测
grep -oiE 'GPTBot|ClaudeBot|PerplexityBot|OAI-SearchBot|ChatGPT-User|Google-Extended' \
/var/log/nginx/learning.access.log | sort | uniq -c | sort -rn
新变量处理完,最后一章把所有能力收拢成一套可长期运行的治理框架。