今年 6 月,欧洲经济政策研究中心(CEPR)发布了一篇讨论论文,编号 DP21577,标题直译过来是《生成式 AI 的学习惩罚:来自中国中等教育的证据》。三位作者,斯德哥尔摩大学的 David Strömberg、香港大学的 Victor Lei 和 Yanhui Wu,拿到了中国中部一个县 26,811 名中学生的行政数据,时间跨度 30 个月,覆盖 7 到 12 年级、九个学科,并且把每周的作业分数与耗时、月度闭卷考、全县统考、中考和高考串在了同一份面板里。
数据规格之外,这篇论文还有一层稀缺性。此前关于 AI 与学习的研究,大多测的是实验室或课堂里被指定使用某个 AI 家教的学生;这篇测的是现实环境里自己决定用不用、怎么用 AI 的学生。2022 年 9 月样本开始时几乎无人使用,到 2025 年 6 月已有约八成学生报告在用;样本末期的调查中,最常被报告的工具是豆包和 DeepSeek,都是通用型 AI,不带教育功能设计。因为学生开始用 AI 的时间有先有后,作者得以用交错双重差分的方法,比较同一时期内「已经开始用」和「还没开始用」的两组人:采纳之前,两组的成绩几乎相同、走势一致。在学生自己决定用不用、又有长期升学考数据的研究里,这是目前最接近因果推断的一份证据。
先把证据等级交代清楚:这是 working paper,尚未经过同行评审;数据来自一个县,外推到别处需要打折。世界银行博客 6 月 18 日的评注(人力资本项目负责人 Gabriel Demombynes 执笔)同时提醒,无法完全排除「某种外部冲击既推动学生用 AI、又拉低成绩」的混杂因素,尽管作者指出不用 AI 的学生几乎从未出现这种幅度的下滑;世行由此判断残留混杂的作用很可能很小,但真实效应可能比论文报告的略小,这一点留待同行评审处理。下面的效应估计都要带着这个前提读。
作业更快更高分,闭卷考反向跌了两成
采纳 AI 后的半年内,学生完成一份作业的平均时间从 64 分钟降到大约 45 分钟,少了约 30%;作业分数相对采纳前的均值涨了 18%。如果故事停在这里,一切看上去都是收益:产出更好,耗时更短。
但作业只是练习的载体,学习效果要看闭卷考试。同一批学生的月度闭卷考成绩,在半年后跌了 20%——同样相对采纳前均值。这个幅度是什么概念?世界银行的评注把约五个月后的月考跌幅折算成 1.4 个标准差,并拿尼日利亚一项 AI 辅导随机实验的 +0.31 个标准差做参照;两项的科目、设计和结果定义都不同,这个参照只能说明世行为什么觉得这个跌幅大。另一项可对照的研究发表于 2025 年的 PNAS:宾夕法尼亚大学团队在土耳其一所高中做随机实验,学生用无护栏的 GPT 界面学数学,练习成绩明显上升,但当堂随后的闭卷考比对照组跌了 17%;同一实验里只给提示、不给完整答案的版本,闭卷成绩与对照组没有显著差异。方向相同,但科目、时长和估量对象都不同,不能当成同一份证据的复制。

不用 AI 的学生里,作业分和考试分照常正相关,作业一直是学习效果的有效指标。在用 AI 的学生里,这个关系不再成立:作业分更高的人,考试更差的可能性反而上升。作者的结论是,对这个群体而言,作业分不再能用来评估学习,作业分的快速上涨应该被读作学习在下滑的预警信号。
账单两年后才全额到账
惩罚不是一次到位的。月考主要考近期内容,效应在采纳后约六个月成熟;中考和高考考的是数年累积的内容,损失用了大约两年才完全兑现,最终幅度与月考相当:相对基线均值,中考跌 24%,高考跌 18%。作者据此提醒,只跟踪几周的短期研究,很可能系统性地低估了长期使用生成式 AI 的学习成本。
损失的分布也不均匀。按学科看,社会科学类(历史、政治等)跌约 27%,STEM 约 22%,英语约 17%,语文约 9%。按人群看,低年级、男生、原本成绩靠前的学生跌得更重。劳动力市场的研究反复发现,AI 压缩技能分布的方式是抬高尾部,技能较低的从业者获益更多;而在这个教育场景里,压缩来自顶部塌陷,惩罚最重地落在尖子生身上。

用 AI 的学生里,约八成像在外包
损失集中在一种特定用法上。采纳约半年后的 AI 使用者里,大约每五个里有四个,完成作业的时间低于 50 分钟——比不用 AI 的学生里最快的还快——同时拿到与 AI 工具解题能力相称的高分;这些学生的闭卷考成绩明显更差。作者把这个组合,耗时异常短加分数异常高,读成一种行为指纹:作业被大面积外包给了 AI。这是按行为做的分类,不是学生自述的意图。
耗时没缩短的那约两成学生,作业分更高,考试分与不用 AI 的同学相近——论文摘要的措辞是「小幅学习损失」,相近,但不是零差距。换句话说,同样在用 AI,把时间花下去的人,学到的东西基本没受影响。
作者自己也强调,这不意味着强制拉长作业时间就能恢复学习——选择不同用法的学生,在动机、信息和 AI 技能上可能本来就不同。作者认为有效干预得同时做几件事:监督作业时间、引导有生产力的用法、如实告知外包的代价。

作业这个信号,先被废掉了
接下来两节是我们的解读,不是论文原话,先说明。
论文测到的机制是:作业分这个指标,对不用 AI 的学生仍然有效,对用 AI 的学生失效了。作业在教育系统里本来同时干三件事:学生通过它练习,老师通过它判断教没教会,家长通过它判断孩子学没学好。三层用途共用一个数字,现在这个数被污染了——练习那一层可以空转,测量那一层照常出数,而且出的是更好的数。
被污染的指标不会立刻报警,它会继续给出读数,甚至给出更好的读数,涨 18% 的作业分。如果老师和家长仍然把作业分当学习指标,他们看到的是形势向好。这个县的数据里,闭卷月考大约半年后已经跌了两成,但只有看月考的人才能看见;升学考的全额惩罚,要到采纳后约两年才兑现。只看作业分的人,要到那时才知道出了事。
作者给出的补救方向也顺着这个逻辑:既然作业分失真了,就盯没被污染的量——实际花在作业上的时间,以及频繁的、随堂的、闭卷的短测验。这些建议听上去朴素,但它们针对的正是信号失真的位置。

我们没有月考
我们没有教育场景的一手经验,只有两段相邻的,点到为止。
一段是成年人的自学。离开学校之后,「学会没学会」没有月考兜底。我们日常工作里大量用 AI 学新工具、新领域,验收标准只能从真实的项目交付反推:agent 起草的东西能跑通验收才算数,不看「看懂了」。中学生至少还有闭卷考做终极裁判,成年人没有月考这种频率的闭卷账。
另一段是供给侧。我们给客户开发过学生使用的 AI 系统(按惯例不点名)。开发工具的人读到这篇论文,检查的是自己产品奖励的是哪一种用法。论文里有个值得记住的对照:设计良好的 AI 辅导工具在很多地方已经接近零成本,但多数学生不用——他们偏好能直接给答案的通用工具。作者们的判断也在这里收束:这个问题不是技术的,是组织和制度的。
我们上一篇写过自己的认知卸载清单(【链接待补:我们把思考外包给 AI 之后】),讲的是成年人的工作里什么能卸、什么要死守。这篇论文是同一个问题在考场上的版本,只是中学生手里没有清单,也没有人告诉他们需要一张。
最后
把证据等级再说一遍:这是一篇未经同行评审的 working paper,数据来自中国中部一个县,因果识别依赖「采纳时机」的准实验设计,世界银行评注提到的混杂因素无法彻底排除。它测出的效应值也未必能平移到别的地区、别的学龄段。
同时应该如实写下的是:论文摘要里,维持原有作业节奏的那组使用者是小损失,不是零损失;损失集中在约八成的外包式用法上,论文没有说 AI 本身有害。对家里有中学生的人,这篇论文最实用的落点可能只有一个:作业分还涨着的时候,看一眼耗时。
欢迎关注「潜在工作室Tech」,我们记录自己用 AI 干活的真实账目,也会继续拆读这类研究。之前写过的认知卸载清单和这篇是同一条线,后续还会沿着这条线写。
潜在工作室Tech
看见表象之下