最常见的误操作来自把 robots.txt 当成“控制收录的总开关”。它实际只影响爬虫能否抓取某个路径,不保证页面不被索引,也不负责删除已经收录的结果。时间和人手有限时,最先处理的不是把规则写得多复杂,而是确认每一行到底在阻止什么、会不会误伤整站。
robots.txt 的作用对象是爬虫的抓取行为。一个 URL 被 Disallow 后,如果其他页面仍链接它,或者它已被外部引用,搜索引擎仍可能在不抓取内容的情况下将其收录,只是缺少摘要。因此,想移除已收录页面,应优先使用页面级 noindex,并确保该页面允许被抓取,否则爬虫看不到 noindex。
最常见的误操作是 Disallow: /。它表示禁止抓取整站,常用于测试环境,却容易被复制到正式环境。另一个高频问题是路径前缀写得太宽,例如想屏蔽 /search,却写成 Disallow: /,结果所有页面都受影响。
可以按以下顺序检查:
/robots.txt 直接访问。$。如果站点有多个子目录或参数 URL,建议先用少量测试路径验证,再决定是否扩大范围。时间和人手有限时,优先处理会屏蔽整站或核心目录的规则,而不是追求规则数量。
修改后不要只看文件内容。应分别检查:目标 URL 是否仍可被抓取、是否出现在搜索结果中、页面级 noindex 是否被正确读取。若发现“已禁止抓取但仍有收录”,这通常说明索引来自历史记录或外部链接,而不是 robots.txt 失效。
站点地图也不保证收录。它只是发现 URL 的辅助方式,不能替代内容质量、内部链接和抓取预算判断。HTTPS 同样不保证安全无漏洞或排名提升,它只是传输层条件之一。
每次修改 robots.txt 后,至少记录修改时间、修改人、影响路径和验证结果。若站点改版、目录迁移或新增搜索参数,应重新检查旧规则是否仍然适用。对于已确认需要移除的页面,优先使用 noindex 或服务端返回 404/410,而不是长期依赖 Disallow。
下一步可以直接做一件事:打开当前 robots.txt,找出所有以 Disallow: / 开头且范围覆盖首页或核心目录的规则,逐条确认是否真的需要禁止抓取。若无法确认,先收窄路径再观察抓取和收录变化。