上线前核对抓取与索引配置,核心不是“让搜索引擎立刻收录”,而是确认三件事:允许抓取、值得抓取、可被正确索引。常见误解是“页面能打开就等于能被收录”,实际上抓取、索引、展现是三个独立环节,任何一环被阻断,页面都不会出现在搜索结果中。正确的核对方式是先检查 robots.txt 与 meta 指令是否放行,再检查页面结构是否可抓取,最后用实际工具验证索引状态。
robots.txt 只控制抓取,不控制索引。一个页面即使被 Allow,如果同时带有 <meta name="robots" content="noindex">,仍然不会进入索引。反过来,被 Disallow 的页面仍可能因外链被索引,只是搜索引擎无法读取内容。核对时要分别检查两层:
<head> 中是否存在 noindex、nofollow 或 none。X-Robots-Tag 的 noindex。适用条件:新站或改版站最容易在测试环境遗留 noindex,上线时忘记移除。判断结果:如果 robots.txt 放行但页面仍不索引,优先查 meta 与响应头。
sitemap 是发现工具,不是收录保证。它的作用是告诉搜索引擎有哪些 URL 可供抓取,但最终是否抓取、是否索引,取决于页面质量、重复度、服务器稳定性和抓取预算。核对时不要只看“已提交”,而要看“已抓取”和“已索引”的差异。
可执行步骤:
适用条件:内容量较大、分类页和筛选页较多的站点。判断结果:若大量 URL 长期“已发现但未抓取”,通常是抓取预算被低价值页面占用。
上线前常见的两种做法是:方案 A 先全部放行,上线后再逐步屏蔽低质页面;方案 B 先只放行核心页面,再逐步开放。两者适用条件不同。
判断依据:如果站点有大量参数页、空分类页或测试内容,优先方案 B;如果站点结构简单、内容已定稿,方案 A 更直接。无论选哪种,都必须在上线当天完成一次全站抓取与索引状态核查。
检查项要落到具体 URL,而不是只看首页。抽样时至少覆盖首页、栏目页、详情页、分页和筛选页各一个。
完成上述核对后,下一步是持续观察抓取与索引数据的变化,而不是上线当天就要求全部收录。建议在上线后一周内,每天抽查核心页面的索引状态,并对“已发现未抓取”和“已抓取未索引”两类 URL 分别处理:前者检查内链与 sitemap,后者检查内容质量与重复度。只有把抓取、索引、展现分开核对,建站规划方案的上线环节才算真正闭环。