先给结论:如果升级说明里明确写了评分项、权重或数据口径发生变化,那么前后差异应当按“新规则重新计算历史数据”来解释,而不是当成业务本身突然变好或变差。反过来,如果升级只涉及界面、导出格式或速度,评分却整体漂移,那更可能是数据源覆盖或采样方式变了,此时不应直接沿用旧基线做决策。判断的关键不是差异大小,而是差异是否集中在某几个评分项上。
规则评分变化通常来自三类原因,处理方式完全不同。
可区分的证据是:把同一时间点的历史快照分别用新旧规则重算。如果重算后差异消失,说明是模型问题;如果重算后差异仍在,说明是数据或业务问题。这一步能直接决定下一步是“重设基线”还是“排查数据源”。
当满足以下条件时,可以把新版本首次全量结果作为新基线:升级说明确认评分项或权重有变;你已用历史快照验证过差异主要来自规则;且业务侧近期没有同步做过大规模改版。此时旧分数不再可比,继续拿旧基线看涨跌只会得到误导性结论。
不满足上述条件时不要重设。典型反例是:升级只改了报告排版,你却发现整体分数下降,于是直接接受新基线。但真实原因可能是新版本把原先未纳入的某些页面也计入了统计,导致平均值被拉低。这种情况下旧基线仍然有效,需要做的是把新增页面单独拆出来看,而不是整体换基准。
假设某站点在升级前某维度得分 70,升级后同一时间点重算为 55。假设升级说明提到该维度权重从 20% 调到 30%,其余项不变。此时可以先按旧权重把新分数还原,看是否能回到接近 70 的水平。如果能,说明差异来自权重调整,属于可解释变化;如果不能,就要检查该维度的原始指标是否也被重新定义。这个还原动作的价值在于:它把“要不要重设基线”变成一个有验证步骤的判断,而不是凭感觉接受或拒绝新分数。
建议先选 10 到 20 个有代表性的对象,覆盖头部、中部和长尾,分别记录新旧两版的分数和排序。对照结果会出现两种走向:
这个对照动作的结果会直接影响下一步:排序稳定就可以放心用新分数做趋势跟踪;排序不稳则需要先固定数据口径,再谈评分解释。无论哪种走向,都要把升级日期和规则版本记在报告里,避免几个月后再次面对无法解释的断点。
最后提醒一点:请求量、抓取量或某项统计归零,不能单独证明规则改动方向正确,它也可能来自采集延迟、过滤条件变化或权限调整。解释前后差异时,把规则变化和这些外部因素分开验证,结论才站得住。