试验性工作的“完成”不能定义为排名或流量达标,而应定义为在约定周期内执行了指定动作、产出了可复核的过程记录,并据此做出继续、调整还是停止的决策。也就是说,完成的是验证任务本身,不是业务结果。
判断能不能把试验性工作定义为“完成”,第一步不是看合同写没写结果,而是看这项工作有没有可验证的假设。条件不同,完成标准完全不同。
两种条件混用是争议的主要来源。可验证假设被按结果验收,外包方会觉得不可控;不可验证假设被按动作验收,需求方会觉得钱花了没结论。
如果假设可验证,完成标准应包含三件事:执行范围、执行证据、观察窗口。例如约定“对指定的一批模板页调整标题与内链结构,输出变更前后对照清单,观察四周”。
这里的“完成”指变更清单已交付、变更已上线、观察数据已整理成可读记录。至于数据变好还是变坏,属于下一轮决策的输入,不属于本次完成与否的判定。
一个假设的例子:某站点有若干分类页长期不被抓取,双方约定只改这些页面的入口链接和站点地图提交方式,观察四周。若四周后抓取分布没有变化,这次工作仍然算完成,因为动作和记录都到位了;接下来要判断的是假设是否被证伪,而不是追责。
实际动作与下一步影响:在外包合同中把“完成”写成一份变更清单加一份观察记录,而不是一个结果数字。这样做的结果是,验收时双方看的是同一份材料,讨论会从“效果好不好”转向“假设是否成立、要不要换方向”,下一轮预算和范围也更容易定。
如果假设不可验证,不要试图用短期数据证明对错。更现实的做法是把完成定义为:在约定周期内产出约定数量的样本,并给出一个明确的下一步建议。
这种情况下,“完成”是一份带结论的决策文档。结论可以是“证据不足,建议再观察一个周期”,这依然是合格交付,因为它让需求方知道下一步该做什么。
例外:如果试验涉及付费投放或平台推荐流量,样本量和周期要单独约定,因为这两类渠道的数据波动来源与自然搜索不同。把它们的表现混在一起评估,会让任何结论都站不住。
验收试验性工作时,先看交付物是否对应事先约定的层级:是动作记录、样本产出,还是决策建议。再看记录是否可复核,例如变更清单能否逐条对应到页面,观察数据能否说明采集口径。
不要把“某项数据归零”或“某段时间没有增长”单独当作处理正确的证据,也不要当作处理失败的证据。抓取量下降可能来自站点改版、服务器波动或抓取预算重新分配,这些都需要排除后才能下判断。
真正影响下一步的,是这次试验有没有缩小不确定性。如果一轮工作结束后,双方对“该继续做什么”比开始时更清楚,这次试验性工作就达到了它应有的完成状态。