KEEL · 龙骨 · A CURRICULUM FOR THE AI ERA
03 · Google Search Console:让 Google 知道你存在 — keel 龙骨
本章目标:完成站点所有权验证,提交 sitemap,并学会用「网址检查」主动催收录。 验收标准:GSC 中 sitemap 状态为「成功」,且能用网址检查工具看到"已编入索引"。
本章目标:完成站点所有权验证,提交 sitemap,并学会用「网址检查」主动催收录。
验收标准:GSC 中 sitemap 状态为「成功」,且能用网址检查工具看到"已编入索引"。
为什么先做 Google:它是唯一提供完整索引诊断数据的平台,而且 Bing 可以直接从 GSC 导入(第 04 章),一次验证两处生效。
一、添加资源:填对那个前缀
- 打开 https://search.google.com/search-console/,登录 Google 账号
- 左上角「添加资源」→ 选 「网址前缀」(不是"网域")
- 填入:
https://www.xxxxxx.cn/
两个关键选择:
① 用「网址前缀」而不是「网域」
「网域」类型要求 DNS 加 TXT 记录且覆盖所有子域与协议,配置更重。「网址前缀」只针对你填的那一个前缀,够用且验证方式更多。
② 填 https:// + www,与 canonical 保持一致
如果你填 https://xxxxxx.cn/(裸域名),而站点 canonical 是 www 版本,GSC 会显示"网址不匹配",数据不完整。
原则:填什么,就只统计什么。 想同时覆盖两个域名,就添加两个资源——但本站建议只管 www 一个,避免自己跟自己抢权重。
二、验证所有权:三种方式
方式 A:DNS TXT 记录(推荐)
GSC 会给出一条形如 google-site-verification=abc123... 的 TXT 记录。
去你的 DNS 控制台添加:
主机记录:www(或 @,按 GSC 提示填)
类型: TXT
记录值: google-site-verification=abc123...
TTL: 600
等待解析生效(dig www.xxxxxx.cn TXT +short 能看到该值),回到 GSC 点「验证」。
✅ 优点:不依赖服务器,不需要改代码
⚠️ 验证通过后不要删除这条记录——删了会导致所有权失效,GSC 会在几周后停止更新数据
方式 B:HTML 文件上传
GSC 让你下载 google1234abcd.html。把它放到站点根目录(https://www.xxxxxx.cn/google1234abcd.html 能访问),然后点验证。
sudo cp google1234abcd.html /home/ubuntu/fqm/projects/learning-platform/public/
curl -s -o /dev/null -w "%{http_code}\n" https://www.xxxxxx.cn/google1234abcd.html # 必须 200
注意:如果 nginx 里有"未命中路径回退 index.html"的规则,要确认这个 html 文件能被静态命中而不是被 SPA 接管(它确实在磁盘上,所以会命中)。
方式 C:已有的 Google 服务
如果你已经在该域名上用了 Google Analytics 或 Google Tag Manager,可以直接用它们的验证权限。
选哪个
有 DNS 权限就用 A;DNS 在别人手里就用 B。不要为了验证临时关 HTTPS 或改 nginx 配置,成本远高于加一条 DNS 记录。
三、提交 sitemap
- 左侧菜单 → 「站点地图」
- 输入:
https://www.xxxxxx.cn/learning/sitemap.xml - 点「提交」
注意只填路径本身,不要填域名根:sitemap 只覆盖它自己列出的那些 URL,提交根的 sitemap 不会自动发现子路径的。
看状态
| 状态 | 含义 | 怎么办 |
|---|---|---|
| 成功 | 已读取,URL 数与你的 sitemap 一致 | 等收录 |
| 无法读取 | 404 / 格式错 / 超时 | 先 curl 确认能拿到,再看 GSC 给的具体报错 |
| 已发现但待处理 | 排队中 | 正常,等几小时到几天 |
"成功"≠"已收录"。sitemap 只是告知清单,是否收录由 Google 自己判断。
四、主动催收录:网址检查
对于重点页面(新发布的、重点推广的),用顶部搜索框:
- 输入完整 URL → 回车
- 点「请求编入索引」
- GSC 会现场跑一次抓取,告诉你:
- ✅ 网址已编入索引 → 完成
- ⚠️ 已抓取,但目前未编入索引 → 质量或权重问题,通常等更久
- ❌ 无法抓取 → 检查是否有 301/404/robots 拦截
这个工具还有个重要用途:看 Google 实际渲染的 HTML。展开「查看已抓取的页面」→「屏幕截图 / HTML」,能直接确认爬虫有没有拿到正文(对应第 01 章的自检)。
每个 URL 每天可以请求一次索引,对全站几百个页面不现实——只对重点页用,其余靠 sitemap 自然发现。
五、看数据的正确姿势
「网页」报告(核心)
- 已编入索引:收录量曲线。提交 sitemap 后 1~4 周开始增长属正常
- 未编入索引及原因分类:
已抓取 - 尚未编入索引:最常见,说明 Google 抓了但觉得不够重要,靠内容与内链积累解决已发现 - 尚未抓取:抓取预算不足或优先级低,靠内链与更新频率解决被 robots.txt 屏蔽:回去查 robots.txt已排除 - 重复的网页:canonical 配置问题,回第 01 章重定向:sitemap 里混进了会跳转的 URL
「核心网页指标」与「移动设备易用性」
对应第 07 章的性能优化,先看 GSC 这里的现场数据(field data),比本地 Lighthouse 更真实。
时间预期
| 阶段 | 预期 |
|---|---|
| sitemap 被读取 | 提交后几小时到 3 天 |
| 首批页面收录 | 1~4 周 |
| 长尾页面陆续收录 | 1~3 个月 |
| 排名稳定 | 3~6 个月 |
前两周没动静完全正常。 用 site: 查询可以看到客观进展,不必每天刷。
六、本章验收
- 资源已添加,填的是
https://www.xxxxxx.cn/(与 canonical 一致) - 所有权验证通过(DNS TXT 已保留不删)
- sitemap 提交成功,URL 数与 sitemap 实际条数一致
- 抽样 3~5 个重点页用「网址检查」确认可抓取、已请求索引
- 无任何"被 robots.txt 屏蔽"或"重复"类报错
# 提交前的最后自检
curl -s https://www.xxxxxx.cn/learning/sitemap.xml | grep -c '<loc>'
curl -s -o /dev/null -w "%{http_code}\n" https://www.xxxxxx.cn/robots.txt
Google 这条线走通后,第 04 章处理百度与 Bing ——那里的策略会有明显不同。