桌上并排放着两件东西:一张 95 分的期末卷,和判断档案里的一条记录——旧物置换项目那条:报名从 11 人到 47 人;一位受访者认为视频未经充分同意就被传播,她道歉、撤下、重发;然后写下一句校准:"效果好不能豁免程序。"
卷子证明她掌握了有标准答案的部分;档案记录她在没有标准答案处如何行动。五年后回看,哪一件更接近她这个人?——评价重写要回答的就是这个问题。
分数测的是答案对错,而答案已经免费。评价必须转向判断质量。本书给出三件替代仪器。
每个学生的核心评价物,一条一条记录:面对什么情境 / 我如何定义问题 / 做了什么判断 / 依据什么 / 让渡了什么给 AI(几级)/ 后果如何 / 我如何校准。它是智能密度 D2 自评表的学生版——七个字段里有三个直接来自密度体系(判断点、让渡等级、校准记录)。
判断档案的杀伤力在于它不可代写:AI 可以替你完成作业,无法替你经历后果。AI 甚至可以生成一段文笔更好的"反思"——但生成的反思没有价格,因为它背后没有真实发生过的疼。档案的价值锚在后果上,这与《判断经济学》"验收与担责不可复制"是同一条公理的两端:市场不为可复制之物付钱,评价不该为可代写之物给分。
这不是教育独有的发明。一家完成了大规模数字化的制造企业,老板的结论是一句反常识的话:"我们完成了巨额的数字化,但没有把数字资产转变为公司的经营资产。"证据是两件小事:一款抽屉箱卖出两千个,无人跟进为什么好卖;跨境业务的财务问题,一年半后才被发现。
数据一直都在,缺的是数据流与决策流之间的那座桥——没有人记录"我基于这些数据做了什么判断、依据什么、后来对不对"。他们开出的药方叫决策留痕与判断回流:要求业务部门对系统给出的建议做出记录在案的判断,再与真实经营结果比对。
把这段话里的"业务部门"换成"学生","经营结果"换成"作品的真实反馈",你会发现它逐字就是判断档案。企业为它付钱,是因为没有它,AI 学不到这家公司的判断;学校为它评分,是因为没有它,学生学不到自己的判断。同一个装置,两端都在证明:可复制的是数据,值钱的是判断留下的痕迹。
认知工程派的判断三指标移植进课堂:一致率(同类情境下你的判断稳定吗)、复现率(换个新情境你的判断依据还成立吗)、边界自知(你知道自己哪里不知道吗)。
三者中边界自知的预测力最强——一个能准确说出"这一步我没把握、需要查证"的学生,其判断力增速远超盲目自信者;它同时是验收力的核心构件(第三章)。它也最可教,而且教法便宜得惊人:在量规里给"标注不确定"加分,而不是扣分。
传统评价把"我不确定"当扣分项,于是训练出满纸自信的空判断——学生学会的第一件事是掩盖不确定,而这恰恰是判断力最危险的反面。只要翻转这一格的正负号,课堂的诚实供给立刻改变。
定期抽查学生作业的真实让渡程度(哪些环节实际到了 L 几),过度让渡即预警——这是判断力退化的教育端监测仪。
审计不是抓作弊:审计结果不进成绩,进对话——"这个环节你交给了 AI,你验收了吗?你验得了吗?"
为什么必须不进成绩:指标一旦成为目标,就不再是好指标。让渡等级若记分,学生学会的第一课就是把 L4 写成 L2——评价物会立刻教坏被评价者。审计的全部价值建立在自报真实上,而自报真实只能用"不惩罚"来购买。
这条纪律不是推理出来的,是被一个真实实验教出来的。某课程做学生互评,第一周不带排名:全班互相给出的几乎全是鼓励——评价在这里是社交,是彼此支持。第二周宣布互评分数将与排名挂钩:同一批人、同一套作品,分数普遍被压低。量化本想带来公平,实际激活的是博弈:既然分数是零和的,压低别人就等于抬高自己。
最耐人寻味的是结局:学生自己提出,把判断权还给老师。这一句值得放在整章的中心。它同时证明了三件事:① 引入貌似公平的量化,可能让评价更不公平;② 评价机制会立刻改造被评价者的行为——古德哈特定律的课堂版;③ 当量化崩坏时,人们本能地想把判断交还给一个愿意为结果负责的人——这正是第六章"教师=首席验收官"的权威来源。
设计含义:任何互评或算法评分系统都必须预设一层"人性防御"——发现系统性扭曲时,能把关键判断权收回人手。技术中立,是一个不该做的默认假设。
档案记录发生了什么,量规判断做得怎么样,审计监测有没有在悄悄退化。三者缺一:只有档案没有量规,评价退化为叙事比赛;只有量规没有档案,评价失去上下文;没有审计,前两者都可能在一个已经全面让渡的班级里显得很好看。
| 字段 | 记录要求 |
|---|---|
| ① 情境 | 面对什么真实情境(一句话,可核实) |
| ② 问题定义 | 我把问题定义成了什么(尤其是:我改写了谁给的默认定义) |
| ③ 判断 | 我做了什么无标准答案的选择 |
| ④ 依据 | 凭什么——证据、类比、价值排序,写得出才算有 |
| ⑤ 让渡记录 | 哪些环节给了 AI、各到 L 几(与让渡清单对账) |
| ⑥ 后果 | 真实发生了什么——含坏消息;无后果的条目无效 |
| ⑦ 校准 | 下次我会不同在哪(一句具体的行为改变,不是感想) |
写档案的纪律:每条 ≤ 200 字;一学期条目数即回路转数;⑥⑦ 缺失的条目不计数——这条规则同时是第七章统计口径的防注水阀门。
情境:社区旧物置换活动报名冷清,距活动两周。
问题定义:我把"宣传不够"改成了"大家不觉得值得来"——因为去年来过的人今年没来,说明不是不知道。
判断:不加抽奖,改做三段 30 秒的真实参与者感受。
依据:抽奖买到的是到场,不是"值得来";而我们要解决的是后者。
让渡记录:文案初稿 L3(AI 出三版我改定)、数据整理 L4;问题定义与"什么算成功"自留。
后果:报名 11→47。但一位受访者认为视频未经充分同意被传播——我道歉、撤下、重发。
校准:下次在拍摄前先给对方看一遍将要发布的版本,再拿书面同意。效果好不能豁免程序。
注意最后一句——档案最值钱的部分永远是失败与校准,这也是它不可代写的原因。
押 T-P4(判断档案对五年后职业表现的预测力优于学业分数,长周期)。
不必等五年的先行指标:① 提交让渡清单+档案的班级,AI 参与的自报率上升、隐瞒率下降(评价不惩罚诚实之后,诚实回来了);② 档案条目里⑥⑦字段的完整率逐学期上升(学生开始把失败当资产记录);③ 第七章预言的前哨:开始有雇主或评审在分数之外主动索要档案。
已知失败形态:判断档案被当成作文比赛——文采好的条目得高分,失败与校准被美化掉。防守:评分只看⑥⑦是否具体可核实,不看文采。
回到主线:判断力无法传输,只能生长——档案就是生长的年轮。谁来设计回路、谁验得动这些档案?下一章:教师。