KEEL · 龙骨 · A CURRICULUM FOR THE AI ERA
04 · 百度、Bing 与 AI 爬虫:其余入口怎么处理 — keel 龙骨
本章目标:完成 Bing 提交(几乎零成本),对百度做出基于现实的决策,并理解 AI 爬虫带来的新变量。 验收标准:Bing 站点已导入并通过 sitemap;百度要么完成验证,要么明确记录"放弃并说明理由"。
本章目标:完成 Bing 提交(几乎零成本),对百度做出基于现实的决策,并理解 AI 爬虫带来的新变量。
验收标准:Bing 站点已导入并通过 sitemap;百度要么完成验证,要么明确记录"放弃并说明理由"。
一、Bing Webmaster Tools:最省力的一步
Bing 覆盖国际搜索 + 微软系产品(Edge、Windows 搜索、Copilot),且可以直接从 GSC 导入。
- 打开 https://www.bing.com/webmasters/,用微软账号登录
- 「添加网站」→ 选择 「从 Google Search Console 导入」
- 授权后自动完成验证与 sitemap 同步 ——全程不到一分钟
若不用导入:可加 DNS TXT 或上传 BingSiteAuth.xml 文件,流程与 GSC 同构。
导入后确认 sitemap 已带过来:左侧「站点地图」里应能看到 https://www.xxxxxx.cn/learning/sitemap.xml。没有就手动加一次。
Bing 的一个额外价值:它的「SEO 报告」会给一份站点体检(缺 title、缺 description、链接不可达等),可以作为第 01–02 章验收的交叉验证。
二、百度搜索资源平台:先做现实判断
硬约束(做之前必须知道)
百度对「未备案 + 服务器在境外/港澳台」的站点,普通收录基本不放量。
这不是猜测,是可观察的现象:这类站点提交 sitemap 后,资源平台显示已接收,但 site: 查询长期为 0。
所以第一步是判断自己属于哪一类:
| 情况 | 预期 | 建议 |
|---|---|---|
| 已备案 + 境内服务器 | 正常收录,几周内见效 | 完整走流程 |
| 未备案 + 境外服务器 | 收录概率极低 | 走流程但降低预期;重心放 Google/Bing |
| 未备案 + 中国香港服务器 | 介于两者之间 | 可以试,同时观察 |
如果属于后两类,不要在百度上反复投入——把同样的时间花在 Google 收录与内容质量上,回报高得多。
若决定走:完整流程
- 打开 https://ziyuan.baidu.com/,用百度账号登录,完成站长实名认证(需要手机号 + 身份证)
- 「用户中心 → 站点管理 → 添加网站」,填
www.xxxxxx.cn - 选择验证方式(百度主推 CNAME):
- CNAME 验证(百度推荐):给域名加一条 CNAME 记录指向百度给的验证域名
主机记录:百度给的一串字符 类型: CNAME 记录值: ziyuan.baidu.com 或百度指定的地址 - HTML 文件验证:下载
Baidu_verify_xxxxx.html,放到站点根目录sudo cp Baidu_verify_xxxxx.html <站点根目录>/ curl -s -o /dev/null -w "%{http_code}\n" https://www.xxxxxx.cn/Baidu_verify_xxxxx.html - DNS TXT:加一条 TXT 记录
- CNAME 验证(百度推荐):给域名加一条 CNAME 记录指向百度给的验证域名
- 验证通过后 → 「资源提交 → 普通收录」:
- sitemap 提交:填
https://www.xxxxxx.cn/learning/sitemap.xml - 主动推送(实时):有 API 的话,每次内容更新后把新 URL 推过去,比等 sitemap 快
- sitemap 提交:填
- 「抓取诊断」工具可以模拟百度蜘蛛抓取,用它确认百度能拿到正文(对应第 01 章的自检)
百度特有的两个工具
- 链接分析 → 外链分析:看谁链了你(对判断外部曝光有用)
- 抓取异常:看百度蜘蛛遇到的 404/5xx/超时,是诊断抓取障碍的直接入口
三、其他中文入口
| 入口 | 是否值得做 | 说明 |
|---|---|---|
| 搜狗 | 可选 | 有站长平台,流程与百度类似,量小 |
| 神马(UC/夸克) | 可选 | 移动端份额可观,无独立站长平台,靠 sitemap 与外链 |
| 头条/抖音搜索(Bytespider) | 值得关注 | 抓取频繁,无需提交,robots.txt 放行即可 |
| 微信搜一搜 | 特殊性 | 主要索引公众号内容,普通站点需通过「站点收录」入口申请 |
务实建议:把百度之外的中文入口当作"机器人家来就来",不主动投入。它们大多没有提交后台,靠外部链接与 sitemap 自然发现。
真正需要主动做的只有三个:Google、百度、Bing。
四、AI 爬虫:新的发现入口
现在有一类爬虫不服务于传统搜索结果页,而服务于 AI 回答:
| UA | 归属 | 用途 |
|---|---|---|
GPTBot |
OpenAI | 训练数据抓取 |
OAI-SearchBot |
OpenAI | ChatGPT 搜索索引 |
ClaudeBot / Claude-User |
Anthropic | 抓取 / 用户触发 |
PerplexityBot |
Perplexity | 搜索索引 |
Google-Extended |
Gemini(用 robots.txt 控制,不影响 GSC 收录) | |
Bytespider |
字节 | 豆包/抖音系 |
它们的特点
- 多数不执行 JS → 第 01 章的 SSR/预渲染对它们同样关键,甚至更关键
- 遵守 robots.txt(主流的都遵守)
- 不受 ICP 备案限制 → 这对未备案站点是一个实实在在的补偿通道
- 抓取量大:可以去看日志,很多技术站点的 AI 爬虫请求量已经接近甚至超过传统搜索引擎
策略
- 默认放行。技术内容被 AI 引用带来的曝光是新增量,且这类爬虫不会消耗你的传统抓取预算。
- 观察日志(第 05 章)确认它们抓到了什么。如果日志里只有 HTML 没有内容 JSON,说明它们被 SPA 卡住了。
- 如果想单独控制:
注意User-agent: GPTBot Disallow: /Google-Extended是独立开关,写它不会影响 Google 搜索收录:User-agent: Google-Extended Disallow: / - 不要为了"防 AI"而关掉整个 robots ——那是把传统搜索一起关掉。
五、本章验收
# 1. 验证文件(若用 HTML 验证)可访问
curl -s -o /dev/null -w "%{http_code}\n" https://www.xxxxxx.cn/Baidu_verify_xxxxx.html
# 2. robots.txt 对主流 AI 爬虫是否放行
curl -s https://www.xxxxxx.cn/robots.txt
# 3. 日志里是否出现这些 UA(第 05 章会给具体命令)
sudo grep -c -iE 'GPTBot|ClaudeBot|PerplexityBot|Bytespider' /var/log/nginx/learning.access.log
- Bing 已从 GSC 导入,sitemap 同步成功
- 百度:已完成验证并提交 sitemap,或在文档中明确记录放弃及理由
- robots.txt 对 AI 爬虫的策略已明确(默认放行)
- 已确认所有验证用的 DNS/HTML 记录不会在后续清理中被误删
⚠️ 一条重要提醒:验证记录(DNS TXT / CNAME / HTML 文件)永久保留。很多人清理服务器时删掉 Baidu_verify_*.html,几周后站点所有权失效而不自知——表现为平台突然停止更新数据。
下一章进入诊断:用服务器日志看爬虫到底来没来、抓了什么。