KEEL · 龙骨 · A CURRICULUM FOR THE AI ERA

04 · 百度、Bing 与 AI 爬虫:其余入口怎么处理 — keel 龙骨

本章目标:完成 Bing 提交(几乎零成本),对百度做出基于现实的决策,并理解 AI 爬虫带来的新变量。 验收标准:Bing 站点已导入并通过 sitemap;百度要么完成验证,要么明确记录"放弃并说明理由"。

本章目标:完成 Bing 提交(几乎零成本),对百度做出基于现实的决策,并理解 AI 爬虫带来的新变量。
验收标准:Bing 站点已导入并通过 sitemap;百度要么完成验证,要么明确记录"放弃并说明理由"。


一、Bing Webmaster Tools:最省力的一步

Bing 覆盖国际搜索 + 微软系产品(Edge、Windows 搜索、Copilot),且可以直接从 GSC 导入。

  1. 打开 https://www.bing.com/webmasters/,用微软账号登录
  2. 「添加网站」→ 选择 「从 Google Search Console 导入」
  3. 授权后自动完成验证与 sitemap 同步 ——全程不到一分钟

若不用导入:可加 DNS TXT 或上传 BingSiteAuth.xml 文件,流程与 GSC 同构。

导入后确认 sitemap 已带过来:左侧「站点地图」里应能看到 https://www.xxxxxx.cn/learning/sitemap.xml。没有就手动加一次。

Bing 的一个额外价值:它的「SEO 报告」会给一份站点体检(缺 title、缺 description、链接不可达等),可以作为第 01–02 章验收的交叉验证。


二、百度搜索资源平台:先做现实判断

硬约束(做之前必须知道)

百度对「未备案 + 服务器在境外/港澳台」的站点,普通收录基本不放量。

这不是猜测,是可观察的现象:这类站点提交 sitemap 后,资源平台显示已接收,但 site: 查询长期为 0。

所以第一步是判断自己属于哪一类:

情况 预期 建议
已备案 + 境内服务器 正常收录,几周内见效 完整走流程
未备案 + 境外服务器 收录概率极低 走流程但降低预期;重心放 Google/Bing
未备案 + 中国香港服务器 介于两者之间 可以试,同时观察

如果属于后两类,不要在百度上反复投入——把同样的时间花在 Google 收录与内容质量上,回报高得多。

若决定走:完整流程

  1. 打开 https://ziyuan.baidu.com/,用百度账号登录,完成站长实名认证(需要手机号 + 身份证)
  2. 「用户中心 → 站点管理 → 添加网站」,填 www.xxxxxx.cn
  3. 选择验证方式(百度主推 CNAME):
    • CNAME 验证(百度推荐):给域名加一条 CNAME 记录指向百度给的验证域名
      主机记录:百度给的一串字符
      类型:    CNAME
      记录值:  ziyuan.baidu.com 或百度指定的地址
      
    • HTML 文件验证:下载 Baidu_verify_xxxxx.html,放到站点根目录
      sudo cp Baidu_verify_xxxxx.html <站点根目录>/
      curl -s -o /dev/null -w "%{http_code}\n" https://www.xxxxxx.cn/Baidu_verify_xxxxx.html
      
    • DNS TXT:加一条 TXT 记录
  4. 验证通过后 → 「资源提交 → 普通收录」:
    • sitemap 提交:填 https://www.xxxxxx.cn/learning/sitemap.xml
    • 主动推送(实时):有 API 的话,每次内容更新后把新 URL 推过去,比等 sitemap 快
  5. 「抓取诊断」工具可以模拟百度蜘蛛抓取,用它确认百度能拿到正文(对应第 01 章的自检)

百度特有的两个工具


三、其他中文入口

入口 是否值得做 说明
搜狗 可选 有站长平台,流程与百度类似,量小
神马(UC/夸克) 可选 移动端份额可观,无独立站长平台,靠 sitemap 与外链
头条/抖音搜索(Bytespider) 值得关注 抓取频繁,无需提交,robots.txt 放行即可
微信搜一搜 特殊性 主要索引公众号内容,普通站点需通过「站点收录」入口申请

务实建议:把百度之外的中文入口当作"机器人家来就来",不主动投入。它们大多没有提交后台,靠外部链接与 sitemap 自然发现。
真正需要主动做的只有三个:Google、百度、Bing。


四、AI 爬虫:新的发现入口

现在有一类爬虫不服务于传统搜索结果页,而服务于 AI 回答:

UA 归属 用途
GPTBot OpenAI 训练数据抓取
OAI-SearchBot OpenAI ChatGPT 搜索索引
ClaudeBot / Claude-User Anthropic 抓取 / 用户触发
PerplexityBot Perplexity 搜索索引
Google-Extended Google Gemini(用 robots.txt 控制,不影响 GSC 收录)
Bytespider 字节 豆包/抖音系

它们的特点

策略

  1. 默认放行。技术内容被 AI 引用带来的曝光是新增量,且这类爬虫不会消耗你的传统抓取预算。
  2. 观察日志(第 05 章)确认它们抓到了什么。如果日志里只有 HTML 没有内容 JSON,说明它们被 SPA 卡住了。
  3. 如果想单独控制:
    User-agent: GPTBot
    Disallow: /
    
    注意 Google-Extended 是独立开关,写它不会影响 Google 搜索收录:
    User-agent: Google-Extended
    Disallow: /
    
  4. 不要为了"防 AI"而关掉整个 robots ——那是把传统搜索一起关掉。

五、本章验收

# 1. 验证文件(若用 HTML 验证)可访问
curl -s -o /dev/null -w "%{http_code}\n" https://www.xxxxxx.cn/Baidu_verify_xxxxx.html

# 2. robots.txt 对主流 AI 爬虫是否放行
curl -s https://www.xxxxxx.cn/robots.txt

# 3. 日志里是否出现这些 UA(第 05 章会给具体命令)
sudo grep -c -iE 'GPTBot|ClaudeBot|PerplexityBot|Bytespider' /var/log/nginx/learning.access.log

⚠️ 一条重要提醒:验证记录(DNS TXT / CNAME / HTML 文件)永久保留。很多人清理服务器时删掉 Baidu_verify_*.html,几周后站点所有权失效而不自知——表现为平台突然停止更新数据。

下一章进入诊断:用服务器日志看爬虫到底来没来、抓了什么。

进入 keel 阅读