不要按“已发现/未发现”直接分组。更可靠的做法是先按URL规范化状态分层,再在每一层内部随机划分对照组:规范化正确且已发现的页面、规范化正确但未发现的页面、规范化错误且已发现的页面、规范化错误但未发现的页面。只有后两类之间的差异,才可能说明规范化问题与发现率有关。
“被发现”至少可能指三种不同状态:服务器日志里出现过抓取请求、站点地图提交后状态变为已处理、或者搜索结果中已经能查到该URL。三者含义不同,不能混为一组。
先固定一种可复核的信号作为分组依据,并在整个对照期间保持不变。如果中途更换信号,前后两批页面的分组就不可比。
批量页面往往同时存在多种规范化写法:带与不带末尾斜杠、大小写混用、参数顺序不同、http与https并存、www与非www并存。这些差异会与“是否被发现”纠缠在一起。
假设有400个页面,其中320个规范化正确,80个规范化错误。如果直接比较“已发现”和“未发现”,很可能发现未发现组里规范化错误的比例更高,但这不能证明因果,因为两组页面的模板、内链数量、发布时间可能本来就不同。
分层后再随机划分,可以让每一层内部的页面在已知特征上尽量接近。具体动作是:先导出全部URL及其规范化状态、内链数量、模板类型、首次发布时间,再在每一层内随机抽取一半作为观察组,另一半作为对照。这样得到的分组才具备比较基础。
当页面只有一部分被发现时,常见的做法是保留现状继续观察、改写规范化信号后重新提交、或者直接退出这批页面的处理。三者并非都适用。
适用前提是:规范化状态本身没有明显冲突,未发现的比例在可接受范围内,且没有证据表明错误规范化集中在未发现组。此时保留现状、延长观察窗口是合理选择,代价是等待期间无法确认问题是否恶化。
适用前提是:同一内容存在多个可访问URL,且这些URL之间的canonical、重定向或内部链接指向不一致。改写后需要重新划分对照组,因为原有分组已被破坏。改写的结果会影响下一步:如果改写后观察组发现率上升而对照组不变,才值得继续扩大改写范围;如果两组同步变化,说明变化更可能来自抓取预算或站点整体调整,而不是规范化改写本身。
适用前提是:这批页面本身属于低价值、重复或临时内容,继续投入对照观察的代价高于收益。退出不是失败,而是把资源转移到更值得处理的URL集合。退出后应记录退出原因和范围,避免后续重复评估同一批页面。
假设某站点有200个产品筛选页,其中60个规范化错误,140个规范化正确。运营者把60个错误页面随机分成两组,每组30个:A组改写canonical指向主分类页,B组保持原样。两周后统计日志中的抓取请求数量。
如果A组抓取请求明显多于B组,且同期站点其他页面没有大规模改版,那么可以初步认为规范化改写与抓取增加有关。但要注意:抓取请求增加不等于收录,也不等于排名变化。下一步应检查A组被抓取的URL是否正是改写后指向的规范URL,而不是仍然抓取旧URL。
如果两组抓取请求都增加,或者都不变,则不能把差异归因于规范化改写。此时应检查是否存在站点地图更新、内链调整或服务器响应时间变化等同期因素。
缺少这些记录,后续即使看到组间差异,也无法判断差异来自规范化处理还是其他同期变化。对照组的价值不在于一次比较得出结论,而在于让下一次调整有可追溯的依据。