上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能抓到页面、抓到的页面允许被索引、索引信号指向你希望展示的版本。做法是先在本地或测试环境检查 robots.txt、meta robots、canonical 和 sitemap,再用抓取工具模拟访问,最后到搜索引擎的站长平台提交并观察覆盖情况。任何一项配置错误,都可能导致页面长期不进索引。
很多博客上线后不收录,原因不是搜索引擎不抓,而是作者自己也不清楚哪些页面该被索引。动手前先做一张表,至少包含以下字段:
www 与不带、http 与 https、带尾斜杠与不带。这份清单决定了后面每一项检查的判断标准。没有它,你只能凭感觉判断“看起来没问题”。
robots.txt 放在站点根目录,用 Disallow 告诉爬虫哪些路径不要抓。常见错误是测试阶段写了全站禁止,上线时忘记删除。检查时逐条确认:
Disallow: / 这类全站禁止规则。注意 robots.txt 控制的是“抓取”,不是“索引”。即使允许抓取,页面仍可能因为其他信号不被索引,这一点要分开看。
页面级指令优先级更直接。检查每类模板输出的 <meta name="robots">:
noindex。noindex,follow。X-Robots-Tag,它和 meta 标签效果类似,容易被忽略。如果某个页面既被 robots.txt 禁止抓取,又设置了 noindex,爬虫无法读到 noindex,页面可能仍以其他方式出现在结果中。要避免这种组合。
同一篇文章可能通过多个 URL 访问,例如带参数、带分页、带不同域名前缀。canonical 标签用来告诉搜索引擎哪个是主版本。检查方法:
<link rel="canonical"> 指向该文章的固定链接,而不是首页或列表页。canonical 是建议信号,不是强制指令。如果站内还有大量指向同一文章的不同链接,最好同时修正内链,减少多版本入口。
sitemap 帮助爬虫发现页面,尤其对链接结构较浅的个人博客有用。核对项:
配置改完后不能只看源码,要模拟爬虫实际访问。可以执行以下步骤:
site: 查询观察页面是否进入索引,但注意它只是粗略参考,不同搜索引擎结果有差异。如果页面被抓取但未索引,优先检查内容是否与已有页面高度重复、是否缺少独立价值,而不是反复修改 robots.txt。抓取和索引是两个阶段,证据要分开收集。
上线不是终点。个人博客更新频率不高时,索引状态可能几周才有变化。建议:
下一步,从你博客中选一篇已发布但未收录的文章,按上面的顺序检查 robots.txt、meta robots、canonical 和 sitemap,记录每一项的实际值,再与预期值对比。差异最大的那一项,通常就是需要优先修复的地方。