核心做法是把“可自动评分”和“必须人工判断”分成两条流水线:自动评分只负责可量化、可复核的字段,人工判断负责语义、意图和例外。如果两者混在同一张评分表里,人工判断会逐渐被自动分数吸收,最后没有人真正看原始数据。要防止这一点,需要在流程上设置一个明确的“人工闸门”,而不是靠提醒执行人员多留意。
不是所有查询结果都适合打分。以下三类项目一旦被自动评分覆盖,人工判断就会被架空:
判断标准很简单:如果一个项目换一个执行人员来看,结论可能不同,它就不适合只靠自动评分。可以自动评分的项目应当满足“换人复核结论一致”这个条件。
完全放弃自动评分不现实,它承担的是规模和一致性。可行的做法是保留自动评分,但在它和最终决策之间插入一道人工闸门。具体动作:
这个动作的结果会直接影响下一步:被标记的项目不再参与后续自动汇总,避免人工结论被自动分数平均掉。如果省略这一步,人工复核的意见会在汇总阶段被稀释,等同于没有复核。
很多流程失败的原因是人工判断只存在于执行人员脑子里,没有变成可追溯的字段。改写评分表时,可以把自动评分和人工判断拆成两列:
这样做的效果是,人工判断不再是“感觉不对”,而是一条有依据的记录。后续如果有人质疑为什么某个项目没有被自动评分处理,可以直接查看人工判断列,而不需要重新走一遍流程。
不是所有项目都值得保留人工判断。以下情况可以考虑退出自动评分流程,改为纯人工处理或直接归档:
退出的前提是已经确认自动评分在这个项目上无法产生稳定结论。如果没有这个确认,直接退出只是把问题从自动评分转移到了人工,并没有解决判断依据缺失的问题。
假设有一批查询词,自动评分把其中一部分排在中间位置,既不在明显合格区,也不在明显淘汰区。如果直接按分数取前若干名,这批词会被随机取舍。如果加一道人工闸门,只对这批词做人工复核,复核结果可能显示其中一部分的意图与自动评分的归类不符。此时下一步动作是:把复核结论写回评分表,并调整这批词在后续汇总中的权重,而不是重新计算自动分数。这个例子的数字仅用于说明比较方法,不代表任何实际工具的评分标准。
需要核对的是:具体工具的字段名称、临界区间的定义方式、人工复核队列的触发条件,这些信息因工具和流程而异,不能直接套用。