先别把它当成全站故障。更可能的解释是:收录统计对带参数的 URL 做了归并或抽样,而异常只出现在某一类参数组合上。要缩小复现条件,第一步是固定一个可重复的最小对照:同一个路径,去掉参数、只留一个参数、保留全部参数,各取一条记录,看统计结果在哪一步开始分叉。分叉点就是后续排查的边界。
如果你手里有一批旧内容,其中大部分页面收录统计正常,只有带特定参数的地址长期不出现,先不要急着改模板或提交。把样本整理成两列:左侧是能正常出现的裸路径,右侧是同一个路径加上可疑参数后的地址。两组之间只允许有一个变量不同,否则你无法判断是参数本身、参数值,还是参数组合导致的差异。
一个可操作的写法是用 site: 查询分别测三组:裸路径、单参数、多参数。记录每组返回的条目数量和是否包含目标地址。如果裸路径有、单参数没有、多参数也没有,说明问题集中在参数进入 URL 之后;如果单参数有、多参数没有,则要检查参数顺序或参数数量是否触发了归并规则。
假设你怀疑是 ?id= 与 ?page= 组合出的地址异常。可以按下面顺序逐层加变量,每加一层就重新查一次收录统计:
id,去掉其他参数。page,去掉其他参数。id 和 page,但交换顺序。如果交换顺序后结果发生变化,说明参数顺序被纳入了识别逻辑;如果换值后恢复正常,说明问题在特定参数值而不是参数名。这个动作的结果会直接决定下一步:前者要检查链接生成逻辑,后者要检查该值对应的内容是否被合并或屏蔽。
旧内容、旧系统或旧合作关系退出时,常见做法是直接屏蔽整类参数。但屏蔽抓取不等于移除索引,也不等于收录统计会立刻归零。更稳妥的顺序是:先确认该参数地址是否还有真实入口和用户价值,再决定保留、规范到裸路径,还是让它自然退出。
可以按这个标准做取舍:如果参数地址仍有站内链接或外部引用,优先保留并给它一个明确的规范目标;如果它只由旧系统生成、没有任何入口,可以停止生成新链接,观察统计变化。注意,统计归零本身不能单独证明处理正确,它也可能来自抓取减少、归并规则变化或查询抽样,需要结合入口是否存在一起判断。
假设你有一条旧页面 /item?id=123&from=old,统计里始终不出现,而 /item?id=123 正常。先不要改 robots.txt,也不要直接提交删除。把 from 换成另一个值,再查一次:如果换成 from=new 后出现,说明是旧值被归并或忽略;如果换成任何值都不出现,说明是 from 这个参数名本身被处理。前者可以保留旧地址并加规范指向,后者更适合停止生成该参数并观察后续统计。
站点地图和 robots.txt 在这里只能作为辅助:站点地图不保证收录,robots.txt 的抓取限制也不等于可靠的索引移除。真正要缩小的是复现条件,而不是先扩大处理范围。
完成上面的对照后,你应该能写出一句可复查的判断,例如:“裸路径正常,单参数正常,id 与 page 同时出现且顺序为 page 在前时异常。”这句话本身就是后续动作的边界:只针对这一种组合调整链接生成或规范设置,其他参数地址暂不动。处理后再用同样的三组样本复查一次,如果异常组合消失而其他组不变,说明你缩小到的条件是对的;如果其他组也跟着变化,说明还有未识别的变量,需要回到参数矩阵重新分层。