结论是:把人工判断项目从工具的“评分对象”改成“证据对象”,自动评分就只能做排序参考,不能直接给出结论。只有当项目可以被拆成可核对的事实、并且每个事实都有独立来源时,这个做法才成立;如果项目本身依赖语境、意图或责任归属,自动评分替代人工判断就会把分歧藏起来,而不是解决分歧。
自动评分擅长处理结构一致、口径稳定的项目,例如同一指标在多个时间点的变化、同一字段是否缺失、同一规则是否被触发。人工判断项目通常具有三个特征:同一事实在不同角色眼里含义不同;判断依赖上下文而不是单一数值;结论会影响后续动作且需要有人负责。
一个可操作的区分方法是:先问“如果两个人对同一份材料给出不同结论,能不能用一份清单核对出分歧在哪”。能核对,就适合让工具汇总证据、人工下结论;不能核对,就不适合把自动评分当作最终判断。工具可以继续用于抓取、归类、提醒和生成待核对项,但评分只作为线索。
第一个动作是给每个判断项写一条“事实句”,只描述可观察到的内容,不写评价。例如把“这个渠道效果差”改写成“该渠道在统计周期内带来的有效咨询数量低于其他渠道”。事实句让不同角色至少能确认讨论的是不是同一件事。
第二个动作是为每条事实句标注来源和口径。来源可以是后台导出、人工记录、客服备注或第三方对账单;口径要写清时间范围、统计对象和去重规则。自动评分如果只读取其中一个来源,就会把其他来源的差异当成噪声过滤掉,而人工判断恰恰需要看到这些差异。
第三个动作是设置“分歧标记”。当两个角色对同一事实句给出不同结论时,不要求工具重新打分,而是把分歧原因写成待核对项:是数据口径不同、时间范围不同,还是对“有效”的定义不同。下一步动作就是核对其中一个变量,而不是继续调整评分权重。
假设某团队用工具给一批营销内容打分,分数由点击率、停留时长和转化次数加权得出。某篇内容得分最高,但人工复核时发现,它的转化次数来自一个短期活动页面,活动结束后同一路径不再产生转化。此时自动评分没有错,它只是把不同口径的数据混在一起。防止替代的做法是:在评分旁保留“转化来源”字段,并规定当来源为短期活动时,该分数只能用于排序,不能直接用于预算分配。
这个例子的关键不是分数高低,而是分数背后的假设是否仍然成立。如果活动结束、口径变化或统计对象调整,原来的评分条件就失效了。反过来说,如果所有判断项都能被拆成稳定口径的事实句,并且分歧可以逐条核对,那么自动评分替代人工判断的风险会明显下降。
如果团队把“人工判断”本身也做成一个评分项,例如让工具根据历史操作记录给判断质量打分,那么前面所有拆分都可能失效。因为判断质量依赖当时的信息完整度和责任归属,历史记录只能说明过去怎么选,不能说明现在该不该选。这个反例说明:防止替代的关键不是增加更多评分维度,而是保留一个不参与评分的核对环节。
选一个当前争议最大的判断项,把它改写成事实句,补上来源和口径,然后让工具只负责汇总这条事实句的相关记录,不输出总分。执行一周后,观察分歧是否从“结论不同”变成“口径不同”。如果分歧仍然存在,继续拆事实句;如果分歧减少,再把同样的方法扩展到下一个判断项。这个动作的结果决定下一步是扩大适用范围,还是先修正口径定义。