先给结论:不要把升级前后的分数直接相减,也不要急着用“算法变了”一句话打发。更稳妥的做法是先确认两次评分是否可比,再把差异拆成“口径变化”和“数据变化”两部分。如果口径变了,旧分数只能作为历史记录,不能作为当前基线;如果口径没变,才值得继续追查数据或页面本身。
解释差异的第一步不是分析分数,而是判断可比性。这里有两个成立条件,对应两种完全不同的处理方式。
条件一:口径未变,只是数据更新。如果升级说明里明确写了评分维度、权重区间、采样范围都没有调整,那么分数变化更可能来自被评对象本身。此时可以继续做逐项对比,把变化落到具体页面上。
条件二:口径已变,评分维度或权重被重新定义。这种情况下,新旧分数属于两套尺子量出来的结果。直接比较没有意义,正确动作是把旧分数归档,用新口径重新建立一次基线,再往后看趋势。
判断口径是否变化,不能只看分数高低。可以核对三处:升级说明里是否提到维度增减、权重区间调整、采样周期变化;同一批对象在新旧版本下的分项得分是否出现整体性偏移;原本得分稳定的对象是否在同一时间点集体变动。如果多个对象同时同向变化,口径变化的可能性更大;如果只有个别对象变化,更可能是数据或页面本身的问题。
多个角色对同一事实有不同理解时,争论“以前是多少分”通常没有结果。更有效的做法是把分歧拆成可以逐项核对的项目,让每个人负责自己能确认的部分。
把这张清单发给相关角色,每人只填自己能确认的字段,比反复口头对账更快收敛。核对完成后,通常会得到两种结果:要么发现两次评分确实不可比,要么把差异缩小到少数几个可追查的对象上。
假设某页面在升级前评分为 72,升级后为 65,升级说明只提到“优化了评分模型”,没有给出维度明细。此时不要直接得出“页面变差了”的结论。
可以做一个对照:选三到五个在升级前后都没有改动的页面,记录它们的新旧分数。如果这些页面也普遍下降 5 到 8 分,说明更可能是整体口径偏移,而不是单个页面退化。如果只有目标页面下降,其他页面稳定,才值得回到该页面检查内容、链接或采集数据是否变化。
这个对照的关键是控制变量:对象不变、时间接近、采集方式一致。满足这些条件,差异才有解释力;不满足,就只能作为线索,不能作为结论。
如果确认口径已经变化,旧分数不是废数据,但不能当基线。可以这样处理:
这样做的结果是:后续讨论不再纠缠“为什么掉了 7 分”,而是转向“新口径下哪些对象低于预期”。下一步的动作也随之明确——先处理新基线中明显偏低的项目,而不是回头修复一个可能并不存在的旧问题。
口径变化能解释一部分差异,但不是所有差异都能用它解释。以下情况需要单独排查:
排查顺序建议是:先排除采集和缺失问题,再确认对象是否改动,最后才考虑规则口径。把不能解释的部分单独列出,比强行归因更可靠。如果某个差异在多个合理解释下都成立,就如实标注“原因待定”,而不是选一个听起来最合理的说法。
每次工具升级后,都可以重复同一套动作:先确认口径是否可比,再把分歧拆成版本、范围、分项、原始数据、缺失五个字段,最后用一批未改动对象做对照。这套动作的价值不在于一次说清所有差异,而在于让下一次升级时,团队知道先看什么、谁去核对、什么情况下可以停止追查。差异本身不可怕,可怕的是用不可比的两个数字反复争论。