个人博客建站:上线前怎样核对抓取与索引配置

📍 WDQWDWQD987AAAAA:216.73.216.171
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /60a2fcaa237d.html
📄

个人博客建站:上线前怎样核对抓取与索引配置

上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能抓到页面、抓到的页面允许被索引、索引信号指向你希望展示的版本。做法是先在本地或测试环境检查 robots.txt、meta robots、canonical 和 sitemap,再用抓取工具模拟访问,最后到搜索引擎的站长平台提交并观察覆盖情况。任何一项配置错误,都可能导致页面长期不进索引。

准备:先列出需要被索引的页面清单

很多博客上线后不收录,原因不是搜索引擎不抓,而是作者自己也不清楚哪些页面该被索引。动手前先做一张表,至少包含以下字段:

这份清单决定了后面每一项检查的判断标准。没有它,你只能凭感觉判断“看起来没问题”。

实施:逐项检查四类配置

1. robots.txt 是否放行了需要的目录

robots.txt 放在站点根目录,用 Disallow 告诉爬虫哪些路径不要抓。常见错误是测试阶段写了全站禁止,上线时忘记删除。检查时逐条确认:

注意 robots.txt 控制的是“抓取”,不是“索引”。即使允许抓取,页面仍可能因为其他信号不被索引,这一点要分开看。

2. meta robots 与响应头是否允许索引

页面级指令优先级更直接。检查每类模板输出的 <meta name="robots">:

如果某个页面既被 robots.txt 禁止抓取,又设置了 noindex,爬虫无法读到 noindex,页面可能仍以其他方式出现在结果中。要避免这种组合。

3. canonical 是否指向规范版本

同一篇文章可能通过多个 URL 访问,例如带参数、带分页、带不同域名前缀。canonical 标签用来告诉搜索引擎哪个是主版本。检查方法:

canonical 是建议信号,不是强制指令。如果站内还有大量指向同一文章的不同链接,最好同时修正内链,减少多版本入口。

4. sitemap 是否完整且可访问

sitemap 帮助爬虫发现页面,尤其对链接结构较浅的个人博客有用。核对项:

验证:用抓取与索引工具收集证据

配置改完后不能只看源码,要模拟爬虫实际访问。可以执行以下步骤:

  1. 用搜索引擎站长平台的“网址检查”或“抓取测试”功能,输入一个文章 URL,查看返回的 HTML 和状态码。
  2. 确认抓取到的 HTML 中,meta robots 和 canonical 与预期一致。
  3. 查看“已发现但未编入索引”或类似报告,判断是抓取问题还是索引质量问题。
  4. 用 site: 查询观察页面是否进入索引,但注意它只是粗略参考,不同搜索引擎结果有差异。

如果页面被抓取但未索引,优先检查内容是否与已有页面高度重复、是否缺少独立价值,而不是反复修改 robots.txt。抓取和索引是两个阶段,证据要分开收集。

维护:上线后持续观察覆盖变化

上线不是终点。个人博客更新频率不高时,索引状态可能几周才有变化。建议:

下一步,从你博客中选一篇已发布但未收录的文章,按上面的顺序检查 robots.txt、meta robots、canonical 和 sitemap,记录每一项的实际值,再与预期值对比。差异最大的那一项,通常就是需要优先修复的地方。

图1 图2

nginx