把教程文章转成实操题,核心不是“题目像不像真实工作”,而是输出能不能被稳定判定对错。对单个样本,只要答案看起来合理就能过关;一旦要批改几十份、还要跨时间复用,模糊输出就会让判定标准漂移。可行的做法是:给每道题规定一个可观察的产物,并写清判定它的最小证据集。做不到这一点时,宁可保留为阅读材料,也不要硬转成题。
适合转成实操题的内容,通常满足一个条件:学习者的产出可以被第三个人在几分钟内核对,而不需要猜测意图。比如“为给定页面写出一条标题标签”,产物是一行文本,核对点是长度、是否包含目标词、是否与页面主题一致。相反,“理解搜索引擎工作原理”这类目标,产出无法被直接观察,只能转成选择题或简答题,判定的是记忆而非操作。
一个实用的筛选动作是:从文章里挑出一个知识点,试着写出“学习者要交什么”。如果写出来的是“一份分析”“一个方案”“一次优化”,说明产物太粗,需要继续拆到具体字段。拆不动,就说明这个知识点暂时不适合做成实操题。
不是所有文章段落都值得转成题。可以按下面三种处理方式判断:
取舍的判断依据是判定成本,而不是内容重要性。一道题如果需要批改者反复揣摩学习者的表达才能给分,它就不适合规模化使用。
可判定的输出通常具备三个特征:有明确载体、有可数的检查点、有边界说明。以“为假设的宠物用品分类页写标题标签”为例,可以这样设置:
这样设置后,批改者不需要判断“写得好不好”,只需要逐项核对。学习者也清楚自己交什么、按什么标准被看。假设规定字符数为三十个汉字以内,那么超出的答案就可直接判定为不合格,而不必讨论创意优劣。
需要注意,检查点不能只写“合理”“通顺”这类词。它们无法区分对错,只会把判定权交回批改者的主观印象。若确实需要评价表达质量,应单独设一档评分,并给出可参照的样例,而不是混进对错判定里。
个别样本能判、批量使用后出现例外,通常有三个原因:场景信息不足、检查点互相冲突、或者题目实际在考两种不同能力。处理顺序是先看例外是否集中在同一检查点。如果集中在同一处,说明该检查点定义不清,应改写措辞或补充示例;如果例外分散,说明题目本身承载了太多目标,应拆成两道更小的题。
还有一种情况需要接受:某些知识点在规模化后必然出现合理分歧,这时应当把它从计分题降为讨论题,只要求学习者写出判断依据,不判定唯一答案。这个动作的结果是题库变小,但每道题的判定稳定性提高,后续复用和批改的成本都会下降。
把文章知识转成实操题,本质是在“贴近真实工作”和“可稳定判定”之间做取舍。倾向真实,就必须接受判定成本上升;倾向可判定,就要接受部分知识只能停留在阅读层面。明确这个取舍,比追求题目数量更有价值。