当筛选参数、排序参数和跟踪参数可以自由组合时,地址数量会趋向无限,但真正值得保留的地址集合并不等于全部组合。可以执行的最小动作是:先按“内容是否随参数改变”和“参数是否影响页面主体”两个维度分类,再为每类指定一个规范代表地址,其余组合统一收敛。这个动作不需要完整日志或后台权限,只需要抽样若干参数组合做对比。它不能直接证明收录会改善,也不能替代搜索引擎的抓取与索引决策,只能让站点对“哪些地址算有效”形成一致定义。
假设一个商品列表页带有颜色、尺码、排序、每页数量和来源跟踪五类参数。颜色和尺码会改变返回的商品集合,属于内容型参数;排序和每页数量只改变同一集合的排列与分页,属于呈现型参数;来源跟踪不改变任何主体内容。
这三类的处理方式不同:内容型参数可以保留有限个有检索价值的组合,例如颜色与尺码各自独立取值时,只保留单参数地址,不保留两两交叉后的全部组合;呈现型参数应指定一个默认值作为规范,其他取值视为同一地址的变体;跟踪参数不进入有效地址集合。
判断依据不是参数名称,而是抽样对比:固定其他条件,只改变一个参数,看主体内容、标题和主要链接是否发生实质变化。如果只是顺序或外观变化,就不应视为独立有效地址。
参数组合的增长方式接近笛卡尔积:三个各含十个取值的参数会产生一千种组合,其中绝大多数没有独立检索需求。有效地址集合的定义应当是一个有限代表集合,而不是全部组合。
可以用以下顺序确定代表地址:
这一步的实际结果是:有效地址集合从理论上的无限组合收缩为可枚举的有限列表。站点地图只覆盖这份列表,不覆盖全部参数组合。需要说明的是,站点地图不保证收录,它只是把代表地址明确告知搜索引擎;是否抓取和索引仍由搜索引擎决定。
缺少日志、索引状态或后台权限时,仍然可以完成定义工作,只是结论范围要收窄。
做完这些,能得到的是一个内部一致的地址定义,而不是收录结果。不能由此推出“参数收敛后收录一定增加”,因为抓取预算、内容质量和外部链接等因素同样影响结果。请求量或抓取量归零也不能单独证明处理正确,它可能来自抽样偏差、访问限制或统计口径变化。
定义有效地址集合时,容易把几个手段混为一谈。规范标签用于指明代表地址,但它只是提示,不保证搜索引擎采纳。robots.txt 的抓取限制不等于可靠的索引移除:被禁止抓取的地址仍可能因外部链接而出现在索引中,只是摘要信息可能受限。如果目标是让某个地址不出现在索引里,抓取限制通常不是合适手段,需要根据该地址是否已收录、是否可访问来分别处理。
因此,有效地址集合的定义应聚焦于“哪些地址值得作为代表”,而不是“如何阻止其余地址”。阻止手段属于另一层决策,混用会让规则互相矛盾:一边用规范指向代表地址,一边又用抓取限制切断代表地址的抓取路径,结果可能适得其反。
假设上述商品列表页最终保留的地址集合是:默认列表页、颜色单参数页、尺码单参数页,以及分页地址。排序、每页数量和跟踪参数全部收敛到默认地址。这个集合是有限的,可以枚举,也可以被复核。
复核时先确认每个代表地址返回的内容是否稳定,再确认非代表地址是否指向代表地址,最后确认站点地图只包含代表地址。如果某一步发现代表地址之间内容重复,就回到上一步合并,而不是新增规则。
这套定义的价值在于可重复:当参数继续增加时,只需判断新参数属于内容型、呈现型还是跟踪型,再套用已有规则,而不必重新讨论全部组合。它不承诺收录结果,但能让站点在参数无限增长时保持一个明确、有限、可执行的有效地址集合。