
作者 | 黄泽敏
编辑 | 向现
将论文挂上网后,吴延晖接到了一通越洋电话。电话那头,是世界银行研究部负责教育的团队。
当时,他们刚提交了一份供各国参考的教育年度报告,但看了吴延晖他们的研究,又连夜把报告撤了回来。
那天晚上,课题组找吴延晖他们讨论了很久。对方惊讶于 AI 对学生成绩的负面影响之大,反复向吴延晖他们确认数值的结果。
吴延晖是香港大学经济学教授。让世界银行连夜讨论的这篇研究,是他和斯德哥尔摩大学经济学教授大卫 · 斯特伦伯格(David Strmberg)等人合作完成的。研究团队调取了中国中部某县 9 所中学 26811 名初高中生、跨度 30 个月的学业记录,并进行了回溯性分析。
研究发现,用了 AI 后,学生作业做得更快、更好了,但 6 个月内,同样是这批学生,月考成绩下降了 20%。
而负面影响随时间推移持续,两年后,学生的中考和高考成绩分别下降了 24% 和 18%。这一研究的发现被总结为 " 学习惩罚 "。

吴延晖 / 受访者供图
几乎在同一时期,世界各地的学校和教育部门,也开始重新审视生成式 AI 入校的边界。
今年 6 月,挪威政府提出,从 2026 年秋季开始,小学生原则上禁止使用生成式 AI。到了 9 月,纽约市宣布,将限制 8 年级及以下学生在校使用生成式 AI。
对于技术能不能改变人的能力这件事,吴延晖原本一直抱有戒心。计算机、互联网、社交媒体的出现,都曾被视为 " 变天 " 或是寄予厚望,但回头看,这些技术更多改变了人的工作方式和生活方式,并没有从根本上改变人所拥有的能力。
但 AI 让他的判断发生了变化。在他看来,AI 相当于一台 " 会思考的机器 ",可以直接从事认知性工作。" 对人的能力来说,AI 这项技术,或许比以往任何技术都更具颠覆性。" 他说。
作业做得更快更好,考试成绩反而一路下滑,这个看似矛盾的现象,把问题推到了所有人面前。AI 进入教育是一个复杂的过程。在他看来,简单地禁止,或是一味地推广,都未必是答案。
以下,是吴延晖的讲述。
2022 年,ChatGPT 刚出来时,教育界更多是乐观的。大多数人认为,它是知识工作者的有力助手,也是学习的好帮手,可以让学习过程变得更顺畅。
但到了 2024 年之后,我开始听到越来越多不同的声音。各个国家的老师都在说,感觉学生变懒了,有些甚至觉得学生 " 变笨了 "。
我在美国的同事也提到,同一门课,考试题目每年差不多,学生成绩却逐年下降。尤其在计算机教育这些 AI 使用比较多的领域,这种变化更加明显。
很多老师觉得,现在的学生越来越不好教,学习能力和学习积极性都和以前不太一样。这种现象不只是发生在普通大学,全世界最好的大学都可能发生。
最开始,大家把这种变化归因于疫情。但疫情过去了,学生没有变回来。于是,大家开始怀疑,技术是否影响了人的能力。我们因此开始研究,想知道这其中到底发生了什么。
最终我们将目光锁定在中国中部的一个县。这个县人口 100 多万,人均 GDP 低于全国平均水平,但当地学生的 AI 使用率已经和美国、英国等国家接近,到 2025 年 7 月样本截止时,AI 使用率在 80% 左右。事实上,学生在学习过程中使用 AI,已经是一个非常普遍的现象。

学生在学习过程中使用 AI,已经是一个非常普遍的现象 /《樱桃琥珀》剧照
之所以聚焦于中学,是因为大学生的许多基本能力已经形成,即使受到技术影响,之后还有机会调整。中学生则处在认知能力和学习习惯形成的阶段。在这个时期,学生受到的影响会持续更久。
在研究中,我们看到了学生不思考的证据。一些学生在作业上花的时间非常短,但他们的作业成绩其实就是 AI 的能力。比如 AI 能做到 90%,他就达到 90%;AI 能做到 85%,他就达到 85%。最后,他们的考试成绩也很差。
研究直观地表明,AI 让学生变懒了。
所谓 " 懒 ",是指开始不思考了。或者说,原本花在做作业的时间,省下来拿去做别的事情、打游戏去了。AI 让人在做作业、思考的过程中走了很多捷径,越来越难被发现。
这不意味着,用了 AI 就会直接变笨。在我们的研究里,有一批学生虽然用了 AI,但总的投入时间没有减少,他们的成绩受损就明显小得多。这些学生大多可能是把 AI 当成一个提示,问一句,然后自己接着往下做,而不是直接要一个答案。
AI 真正影响的,是那些需要勤奋、需要时间的积累才能培养出来的能力。
现在社会认可的能力粗略分成三种。一种是读、写、背、计算这类基础能力。一种是分析、逻辑推理,包括搭建框架、把一件事情讲清楚。还有一种是主动学习、好奇心和创造能力。

《少年派 2》剧照
在目前的考试体制下,基础能力对普通考试比较重要,它更多来自习惯。分析推理能力对高考这类复杂的考试尤其重要。创造能力,则跟创造性工作关系很大。
对于中学生来说,AI 恰恰冲击了他们的分析推理能力。比如,在数学、物理这类学科里,需要一遍遍推理、证明和练习,才能形成相应能力。现在学生用 AI 把这些过程省掉了,能力就会受到影响。
思维上变懒后,会进而影响学生的学习态度和学习习惯。如果长期走捷径,一个人会越来越不能持续地想一个事情,丧失克服困难的态度,甚至把某件事情搞清楚的动力都没有了。
这种变化,光看作业成绩是发现不了的。以前,作业做不好,老师、家长会看到。为了让作业成绩好看,学生不得不思考。
而现在,AI 制造了一种高分假象。学生即使不思考,也能把作业做得很好。老师不说了,家长也不说了,于是学生就心安理得地不思考了。
我自己也用 AI,但用得不算太多。有一些很明确的 " 脏活累活 ",比如写代码、跑模型,或者检验一个数学证明对不对,我会交给 AI 做。这些事情,AI 做得又快又好。
但有一样东西,即使 AI 做得又快又好,我还是没有让它做,就是我的教课讲义和 PPT。因为 AI 做得太平滑了。
教课、学习的过程,一定要有摩擦。
不是所有摩擦都值得保留。笔误、计算错误,这些是没有意义的摩擦,能避免当然要避免。
我说的摩擦,是人在探索一个还不太了解的问题时自然产生的卡顿。这些属于学习过程中自然产生的摩擦。
如果 AI 把这些摩擦全部抹掉,学生就会觉得每一个问题都很容易。可它之所以容易,有时候只是因为难点已经被跳过去了。
但难点恰恰是真正需要突破的。难点被跳过、被简化,思考就不会透彻。我有时会看到,一些人因为用 AI 用得太多,最后连自己都讲不清楚了,因为他的思路已经被 AI 绑架了。

一些人用 AI 用得太多后,思路已经被 AI 绑架了 / 图源:图虫 · 创意
我也常能在我的学生作业里看到 AI 痕迹。大学生用 AI 写作业,这件事是抵挡不了的,我也不认为简单禁止就是办法。但我发现,学生交上来的东西有时越来越像 " 半成品 "。
以前,学生的作业可能有错误,但它是完整的。现在很多作业看起来没有明显错误,却总让人觉得缺了一块。
比如经济学里写一个模型,学生可能把前后的内容都写出来了,中间关键的推理步骤却没有了,跳跃非常大。有时候,AI 还会把复杂的问题简化,最后做出来的东西,看起来很顺滑,其实和原来真正想回答的问题已经不一致了。
这就给老师判断作业质量造成了障碍。对学生来说,花很短的时间做出一个半成品,也学不到什么。
我现在会要求学生,课堂上不要只给我答案,要讲 " 你怎么想的 "。以前的课堂会更侧重于 " 你怎么做 "。而今,AI 很容易告诉你该怎么做,做的过程中又有一些漏洞,搞了半天你也不知道自己在做什么。所以我们现在重点放在 " 你在做什么 "" 你想做什么事情 "。
现在很多时候,我还是在黑板上推导,和学生一起创造知识。尤其是在教比较前沿的内容时,这个过程很重要。
很多人认为,AI 是一个普及性的工具。以前,一个高级员工才能完成的工作,现在很多普通员工用了 AI 以后也能完成,做到和高级员工一样。如此一来,AI 似乎可以缩小差距。这是大家经常讲的 "AI 平权 "。
但是教育不一样。我给你做一个推理。假定 AI 对教育有正面作用,那么资源就很重要。你有更多资源,就能用更好的 AI、更多的 AI,也更有条件学会怎么用,教育效果可能就越好。而城市的资源通常比农村多,那么差距有可能进一步扩大。
反过来,假定 AI 对教育是负面的,就像我们的研究发现的这样,那么监管就很重要。要引导孩子把 AI 用好,不把学习外包出去,需要家长、老师、学校去管理。这些东西其实都属于软性的资源,而城市在这方面一般也比农村强。
所以按照这个逻辑,无论 AI 对教育最终是正面还是负面,城乡差距都有可能扩大。

无论 AI 对教育最终是正面还是负面,城乡差距都有可能扩大 /《父辈的荣耀》剧照
当然,这里面有一个很反差的情况。假定 AI 对教育不好,一个农村地区穷到根本用不起 AI,没有人用,那它反而会因为用不起 AI、没有受到 AI 的负面影响而变好。
但现实是,AI 并没有那么贵。我们看到农村地区的 AI 使用也很厉害。这样一来,问题就变成了:农村有 AI,但谁来管?
AI 造成 " 学习惩罚 " 的一个重要因素,是学生把学习外包出去。而防止外包,需要家庭、家长、学校这些软性的约束。
城市竞争激烈,一个孩子考不好,家长会管,学校会管。但一些农村地区,孩子考不好、没有上好大学,没有那么强的社会约束。差距仍会扩大。
所以从教育的角度,我担心的不是农村没有 AI,而是农村有了 AI 以后,缺少足够的管理和支持。
这个变量在别的国家或许会更明显。文章发出后,很多欧洲的新闻媒体在找我们采访,欧洲国家其实更担心。
因为中国学生若想把学习全部扔给 AI,家长、老师不答应,学生未来找工作也麻烦。这其中存在许多社会约束。但许多欧洲国家目前没有这么大的约束,那么把学习全部外包给 AI 的人可能会更多。

在欧洲,把学习全部外包给 AI 的人可能会更多 / 图源:Unsplash
不只是城乡,未来甚至可能出现两极化社会。
一类人把 AI 用成一个非常好的工具,借助 AI 做得更好、更聪明。另一类人则把学习大量外包出去,越来越不愿意学习,知识固化,能力甚至低于现在的平均水平。
所以无论从城乡还是从阶层来看,AI 平权都不会自动发生,甚至还可能出现相反的结果。
AI 会越来越普及,我相信未来农村也会有大量 AI,这件事情本身并不难。真正难的是,怎么让 AI 去引导教育,让 AI 能够真正对教育本身产生正面作用。
现在很多学校会做一些尝试。比如让学生用 AI 预习,再通过闭卷小测,或者要求学生展示思考过程,记录学生和 AI 的互动过程。这些想法都挺好的,但它们仍解决不了学习的惰性问题。
因为每个学生的情况不一样。最好的学生天分高、基础好、学习能力强,这个阶段让他们自由使用 AI,未必会有什么问题。基础比较弱、又缺乏学习动力的学生,把 AI 工具给他,他不一定会认真使用。中间那一部分普通的学生最复杂,他们的家庭、地区、学习基础都不同,很难指望一套程序让所有学生都能自动学好。
所以,问题会变成究竟由谁来判断,一个学生什么时候该用 AI,什么时候不能用。
中小学生其实很难靠自己形成这种判断。比较现实的办法是,老师在不断探索以后,凭经验知道哪个知识点可以用 AI,哪个难点必须由学生自己思考,再替学生制定规则。
本质上来说,这要求老师要更多去管理学生怎么学习。比如课堂设计,课堂里多少内容拿来讨论,多少内容传授,作业怎么布置、怎么考核。
这意味着,老师要起到企业管理者的功能,管理学生的努力程度、学习曲线。学校还要设计制度,决定哪些行为鼓励,哪些行为需要约束。

国内部分学校已开设 AI 中心,统一指导学生用 AI。在吴延晖看来,这类实践正是为试扭转 AI 学习惩罚所做出的努力。" 这可能是未来的主流模式,至少在比较发达的地区(会是如此)。"/ 受访者供图
规则怎么制定,最终还是要回到教育本身。
目前,跟 AI 相关的教育分两种。一种是教学生使用 AI,把它当成一种工具和技能,这是现在大多数学校比较强调的。另一种,是培养跟 AI 互补的能力,也就是 AI 做不到的东西。我觉得后者会越来越重要。
因为 AI 进步太快了。今天需要专门学习的一项技能,明天可能就不再重要了。
比如,AI 刚出来的时候,出现了 prompt engineering(提示工程)这样的职业,进行写提示词的专业指导。但随着 AI 能力提高,这项使用 AI 工具的技能本身的重要性就会下降。
因此,更重要的培养是那些不会因 AI 升级而贬值的能力,比如思辨能力、好奇心、审美、人际交往等。这些本是传统教育里缺失的、比较难培养的东西。
但这里又出现了一个悖论。
AI 的出现,让更多人重视这些能力的培养。知识越来越容易获得,教育似乎可以把更多时间留给这些能力。
但 AI 本身又可能阻碍这些能力的发展。AI 让人在把知识外包的过程中变懒,也可能让人变孤独,每天只跟 AI 对话,跟社会隔离开。
我觉得,这个问题很难靠一套统一的方案解决。不应该一刀切地禁止 AI,也不能因为 AI 可能有用,就自上而下地推动所有学生都用同一种方式使用 AI。

北京市第二十中学附属育鹰小学学生在人工智能教育通识课《从国防到生活—— AI 人脸识别》了解人脸识别技术 / 新华社记者 马宁 摄
更适合的方式,也许是把它当成一种 " 社会工程 "。先让不同地方、不同学校根据自身情况去尝试,观察学生、老师和学校发生了什么,再一点点把其中的规律总结出来,最后形成更成熟的制度和政策。
它最终还是会落到,教育究竟想留给学生什么。
以前学生会背优秀范文、背模板。现在,也有人会让 AI 生成一篇作文,再把它背下来。表面上看,这两件事似乎没有太大的区别。甚至从韵律、格律、遣词造句来看,AI 生成的东西未必比唐诗宋词差多少。
但它们背后的东西并不一样。AI 生成的内容,没有蕴含人类共同的体验,这背后的文化沉淀是不一样的。
这可以推到一个更远的问题:大家共同认可的审美,到底有多重要?
假设有一天,AI 真的能够创作出一段和莫扎特一样好听的音乐,那么,你听莫扎特,还是听 "AI 扎特 "?
这取决于社会怎么去认同这些事情。我觉得,这会是未来一个很大的争论。
首图为 AI 创意图(制作 / 郭嘉亮)
本文首发于《南风窗》杂志第 21 期
三一生活网





