KEEL · 龙骨 · A CURRICULUM FOR THE AI ERA
07 · 全景复盘:从 URL 到 SERP — keel 龙骨
本章目标:把前六章串成一条端到端主线,形成一个可以随时调用的诊断心智模型。 验收标准:面对任意一个 URL,能复述它走到搜索结果的全过程,并在出问题时定位到具体环节。
本章目标:把前六章串成一条端到端主线,形成一个可以随时调用的诊断心智模型。
验收标准:面对任意一个 URL,能复述它走到搜索结果的全过程,并在出问题时定位到具体环节。
为什么要有这一章:六个环节分开看都清楚,合起来才形成能力。真正的 SEO 诊断不是"背规则",而是看到现象立刻知道该查哪一环。本章就是训练这个映射。
一、六个环节的完整链路
你写了一个页面,URL = https://www.xxxxxx.cn/learning/courses/tools/lessons/1/
│
┌────┴────┐
│ ① 发现 │ 谁指向它?内链 / 外链 / sitemap / 重定向
└────┬────┘ → 无入口 = 不存在
│
┌────┴────┐
│ ② 抓取 │ robots 允许吗?预算够吗?状态码是什么?
└────┬────┘ → 抓到的是 HTML(可能是空壳)
│
┌────┴────┐
│ ③ 渲染 │ 正文在 HTML 里吗?还是靠 JS?
└────┬────┘ → 拿到完整文本
│
┌────┴────┐
│ ④ 索引 │ 可索引吗?重复吗?薄内容吗?
└────┬────┘ → 进入倒排索引
│
┌────┴────┐
│ ⑤ 排序 │ 相关性 / 权威性 / 页面体验
└────┬────┘ → 得到一个名次
│
┌────┴────┐
│ ⑥ 呈现 │ 结果卡片形态:标题/摘要/富摘要/摘要框
└────┬────┘
│
出现在 SERP,被用户看到
这条链路是串联的:任何一环断开,后面的全部无效。所以诊断永远从前往后,不要跳步。
二、症状 → 环节映射表
这是全书最该背下来的一张表:
| 症状 | 最可能的环节 | 先查什么 |
|---|---|---|
| 新页面完全搜不到 | ① 发现 | 有无内链入口 / 是否提交 sitemap |
| 只有首页被收录 | ① 发现 + ③ 渲染 | 内页链接是否 JS 生成 |
| 爬虫日志里某引擎计数为 0 | ① 发现 | 是否提交过该引擎 |
| robots.txt 报错 | ② 抓取 | 是否 5xx、是否 Disallow: / |
| 抓取量很大但收录很少 | ② 抓取 + ④ 索引 | 是否在抓参数页/重复页 |
| curl 源码里没有正文 | ③ 渲染 | 是否 CSR |
| 抓到了但一直"未索引" | ④ 索引 | 薄内容 / 重复 / noindex |
| 收录了但排名很差 | ⑤ 排序 | 相关性 / 权威性 |
| 排名好但没点击 | ⑥ 呈现 | 标题摘要 / 零点击 |
| 页面被收录但内容是登录页 | ② 抓取 | 未登录是否返回 200 |
三、一次真实诊断的走法
假设现象是"课程第 1 课搜不到",按链路逐环排除:
# ① 发现:站内有没有指向它的 HTML 链接
curl -s https://www.xxxxxx.cn/learning/ | grep -c 'lessons/1'
# ② 抓取:robots 是否允许 + 页面状态码
curl -s https://www.xxxxxx.cn/robots.txt | grep -i disallow
curl -s -o /dev/null -w "%{http_code}\n" https://www.xxxxxx.cn/learning/courses/tools/lessons/1/
# ③ 渲染:源码里有没有正文
curl -s https://www.xxxxxx.cn/learning/courses/tools/lessons/1/ | grep -c '本章目标'
# ④ 索引:是否被显式拒绝 + 是否声明规范版本
curl -s https://www.xxxxxx.cn/learning/courses/tools/lessons/1/ | grep -oE '<meta name="robots"[^>]*>|<link rel="canonical"[^>]*>'
# ⑤⑥:用 site: 与目标词人工观察
诊断纪律:
- 从前往后,不要跳步。跳过"发现"去调"内容质量"是最常见的时间浪费。
- 每一环都要有可复制的证据(curl 输出、日志行、GSC 状态),不靠印象。
- 先排除"机制没生效",再讨论"内容好不好"。
四、六个环节与三门课的分工
| 环节 | 本课(原理) | 《SEO 收录与优化》(流程) | 《SEO 拔高》(体系) |
|---|---|---|---|
| 发现 | 链接图与 sitemap 定位 | 提交 sitemap 的实际操作 | 站点地图分层与索引文件 |
| 抓取 | 状态码与预算语义 | 提交平台、日志诊断 | 预算量化、日志事实表、优先级设计 |
| 渲染 | CSR/SSR/SSG 取舍 | 预渲染落地、关 JS 自检 | 混合渲染、渲染一致性验证 |
| 索引 | 倒排与准入判据 | GSC 覆盖率报告阅读 | 结构化数据实体图谱 |
| 排序 | 信号分类、E-E-A-T | 内容与内链策略 | 主题簇、内容衰减策略 |
| 呈现 | SERP 构成与富摘要 | 元数据与结构化数据实操 | 富结果资格排查、AI 搜索 |
一句话分工:本课讲"为什么",收录课讲"怎么做",拔高课讲"怎么规模化与治理"。
五、全课总验收清单
# 一次跑完的六环自检
echo "== ① 发现:首页出链数 =="
curl -s https://www.xxxxxx.cn/learning/ | grep -c '<a '
echo "== ② 抓取:robots 状态 =="
curl -s -o /dev/null -w "%{http_code}\n" https://www.xxxxxx.cn/robots.txt
echo "== ② 抓取:未知路径应为 404 =="
curl -s -o /dev/null -w "%{http_code}\n" https://www.xxxxxx.cn/learning/nope/
echo "== ③ 渲染:正文是否直出(应 >0) =="
curl -s https://www.xxxxxx.cn/learning/courses/tools/lessons/1/ | grep -c '本章目标'
echo "== ④ 索引:robots meta / canonical =="
curl -s https://www.xxxxxx.cn/learning/ | grep -oE '<meta name="robots"[^>]*>|<link rel="canonical"[^>]*>'
echo "== ⑥ 呈现:title 与 description =="
curl -s https://www.xxxxxx.cn/learning/ | grep -oE '<title>[^<]*</title>|<meta name="description"[^>]*>'
- 重要页面从首页出发不超过 4 跳可达(①)
- robots.txt 返回 200 且允许抓取(②)
- 未知路径返回 404,不是软 404(②)
- 关 JS 后正文完整(③)
- 关键页面可索引、canonical 自引用一致(④)
- 关键页面 title/description 为点击而写(⑥)
- 能对任一症状,在第二节的映射表里定位到环节
六. 从原理走向工程
到这里,你已经有了完整的原理地图。接下来会发生什么:
- 想立刻动手让站点被收录 → 进入 SEO 收录与优化,那里有 GSC/百度/Bing 的提交流程与日志诊断脚本。
- 想把 SEO 变成可度量、可回滚的工程体系 → 进入 SEO 拔高,那里把抓取预算、渲染管线、结构化数据、迁移回滚、AI 搜索逐一工程化。
- 想确保每次发版不破坏前面六环 → 把本课的总验收脚本接进 CI 流水线 的门禁里。
原理是地基。地基之上盖什么、怎么盖、怎么验收,是后两门课的事。