有效地址集合不是把所有参数组合都收进来,而是先按“参数是否改变页面主体内容”划一条线:只有会改变主体内容的组合才作为独立地址,其余组合统一归并到无参数或固定参数版本。下面用一个假设情境说明这条线怎么划、划错后会出现什么例外。
假设某工具站有一个结果页,地址形如 /result?type=a&page=2&sort=hot&ref=xxx。其中 type 决定展示哪一类数据,page 决定翻到第几页,sort 决定排序方式,ref 只是来源标记,xxx 可以无限变化。如果按“参数不同即不同地址”处理,仅 ref 一项就能生成无穷多个地址,站点地图和内部链接会迅速失控。真正需要回答的问题是:哪些参数组合值得被当作有效地址,哪些应当被合并或排除。
对每个参数依次问三个问题,可以快速得到初步分类。
按这三步,type 保留,page 和 sort 归并,ref 排除。这样有效地址集合就从无限组合收缩为有限个 type 值,规模可控。
很多团队会先拿一个样本测试:把带 ref 的地址提交,观察是否被处理。样本可能表现正常,于是得出“带追踪参数也能被正确识别”的结论,然后把规则放大到全站。规模化后例外开始出现:不同参数顺序、参数重复出现、大小写混用、空值参数,都会生成新的地址字符串。此时原先的样本结论不再成立,因为样本只覆盖了单一排列,而排列数量随参数个数呈组合增长。
要判断例外来自哪里,可以固定其他变量,只改变一个维度做对照:同一页面分别用参数顺序 A、B,以及重复参数、空值参数各取一个。如果只有部分组合产生独立地址,说明归并规则没有覆盖参数顺序和空值情况,需要把规则从“匹配参数名”改为“先标准化再匹配”。
一个可落地的做法是:在生成站点地图和内部链接之前,先对地址做标准化——统一参数顺序、去掉追踪参数、把空值参数视为不存在、统一大小写。标准化之后再判断是否进入有效地址集合。
这个动作的直接结果是有效地址数量从随参数增长变为随主体内容增长。下一步的复查重点也随之改变:不再看总地址数,而是看是否出现“主体内容相同但地址不同”的新组合。
需要说明,robots.txt 的抓取限制不等于可靠的索引移除,被限制抓取的地址仍可能以其他方式出现;站点地图也不保证收录,它只是提交候选地址的渠道。因此不能用“已写进 robots.txt”或“已放进站点地图”来证明某个参数组合已被正确处理。
另外,抓取量或某类地址数量下降,不能单独证明归并规则正确。它也可能来自内部链接减少、页面本身访问下降或抓取预算重新分配。要区分这些原因,应同时对照主体内容页面的访问与收录状态,而不是只看参数地址的绝对数量。
如果站点使用多个搜索引擎,参数处理的支持情况需要分别核查,不能以一个引擎的表现推断另一个。有效地址集合的定义应以“是否改变主体内容”为准,而不是以某个引擎当前是否抓取为准。这样定义后,即使个别引擎行为变化,集合本身仍然稳定,复查时只需调整提交和归并的细节,而不必重划整条线。