改版前保留搜索基础,核心不是先动页面,而是先从网站日志里确认搜索引擎还在抓什么、抓得顺不顺、哪些地址已经被索引。做法是:导出改版前一段时间的日志,筛出搜索引擎爬虫记录,按状态码和访问频率分组,找出高频抓取页、404页和被重定向页,再把这份清单与现有URL结构对照。只有先看清现状,才能判断哪些路径必须原样保留、哪些可以迁移、哪些应该放弃。
网站日志记录的是服务器收到的请求,不是搜索引擎的索引库。它只能说明爬虫来过、请求了什么、服务器返回了什么。改版前应重点看三类记录:
这里要区分“可能原因”和“已经定位的原因”。日志里出现大量404,可能是改版前就有死链,也可能是测试环境被误抓,不能只凭一个现象就断定是改版导致。
不是所有被抓取的URL都值得保留。判断依据可以按下面顺序排列:
假设某站点日志显示/old-category/每天被抓取多次,且返回200,同时有外部链接指向它。改版时若把该目录整体删除且不跳转,搜索引擎下次抓取会得到404,原有搜索基础就会中断。此时应保留该路径并301到新分类页,而不是只在新页面里放一个链接。
把观察和判断变成可执行的清单,至少包含以下字段:原URL、状态码、抓取频次、是否有外链、是否有搜索点击、改版后目标URL、处理方式。处理方式只有几种:保留、301跳转、410删除、合并到新页。不要对全部旧URL统一跳转到首页,这会让搜索引擎难以判断新页面与原页面的对应关系。
同时检查robots.txt和站点地图。改版前先确认没有误屏蔽重要目录,改版后及时更新站点地图,让新URL结构能被发现。如果使用CDN或反向代理,日志可能只记录代理层请求,需要确认源站日志是否完整,否则会漏掉真实抓取记录。
改版上线后,继续观察日志中的状态码和抓取路径变化。复查项包括:旧URL是否返回301而非404,新URL是否开始被抓取,5xx是否增多,高频抓取页是否仍然可访问。如果旧URL持续404,或新URL长期没有抓取记录,应回到跳转规则和内部链接检查,而不是等待。
下一步可以直接做一件事:从服务器导出最近30天日志,筛出搜索引擎爬虫记录,按状态码和URL分别计数,生成一份改版前的URL处理清单。这份清单就是后续跳转配置和复查的起点。