上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能否抓到页面、抓到的页面是否允许被索引、最终展示的地址是否唯一且正确。如果站点还在测试环境、内容尚未定稿,优先选择“先屏蔽抓取、上线后再放开”;如果内容已经定稿、只是做发布前检查,则应选择“允许抓取、用工具逐项验证”。两种方案没有绝对优劣,区别在于站点当前是否已经具备对外提供稳定内容的条件。
选择哪种方案,取决于上线前站点是否会对外暴露。下面两类情况对应不同处理方式。
判断依据不是“哪种更安全”,而是“当前页面是否已经是最终版本”。只要还有大范围改动,屏蔽更稳妥;已经定稿,放开更高效。
robots.txt 必须放在站点根目录,文件名全小写。它控制的是抓取,不是索引,这一点经常被混淆。常见写法如下:
User-agent: *<br>Disallow: /
上面这段表示禁止所有爬虫抓取全站,适合测试阶段。上线后要改成允许抓取,可以写成:
User-agent: *<br>Disallow:
注意 Disallow: 后面留空表示不禁止任何路径。核对时要检查三点:路径是否写错、是否误屏蔽了 CSS 和 JS 文件、是否残留测试期的全站屏蔽规则。如果 CSS 和 JS 被屏蔽,搜索引擎可能无法正确渲染页面,影响对页面内容的理解。
robots.txt 管抓取,页面里的 meta 标签管索引。上线前要确认每个需要被收录的页面没有残留以下写法:
<meta name="robots" content="noindex">
这类标签常见于测试模板、后台页面或复制来的旧模板。核对方法是抽查首页、栏目页、详情页各若干条,查看源代码中是否出现 noindex。如果页面需要被收录,就应移除该指令或改为 index,follow。同时检查是否有页面通过 HTTP 响应头返回 X-Robots-Tag: noindex,这种写法不会出现在 HTML 里,容易被漏掉。
同一个页面可能通过多个地址访问,例如带 www 与不带 www、带参数与不带参数、http 与 https。上线前要确定一个主地址,并在页面中通过 canonical 指向它:
<link rel="canonical" href="https://example.com/page/">
核对时逐项确认:canonical 指向的地址是否能正常打开、是否与页面实际主地址一致、是否误指向了其他页面。如果 canonical 指向错误,搜索引擎可能不收录当前页面,而把权重集中到另一个地址上。适用条件是页面内容确实唯一;如果多个地址展示的是同一内容,才适合用 canonical 合并。
无论选择哪种方案,上线前都可以按下面步骤检查,并记录验收信号。
https://你的域名/robots.txt,确认文件可打开、规则与预期一致。noindex 和 canonical,确认没有误屏蔽、指向正确。验收信号是:robots.txt 允许抓取、页面无 noindex、canonical 指向主地址、网址检查工具能正常抓取且未报屏蔽。只要其中一项不通过,就先修复再推进下一步。搜索引擎何时收录、收录多少,无法保证,也不应作为上线前的硬性验收条件。
下一步建议:把上面五项整理成一张上线检查表,在正式发布前逐项打勾,发布后再复查一次 robots.txt 和首页源代码,确认没有遗留测试配置。