来源:滚动播报
(来源:科普中国)
今天的通用 AI 已经能够解答常见的中小学题目,而老师尽管可以规定课堂上不用 AI,却很难知道学生离开教室以后怎么做作业。2025 年,中国青少年研究中心做了一次问卷调查,回收了八千多份有效问卷。调查结果显示,超六成受访中小学生用过 AI,其中 18.3% 经常使用;在列举使用方向时,超过七成学生选了“辅助完成作业”[1]。
学生作业是反映学生学习状态的窗口,作业交得更快、分数更高,通常会被当成学得更好。可如果学生用 AI 帮助做作业,这个推断还成立吗?在 AI 的帮助下完成作业,学生是否能学到真本事呢?
最近有一项研究发现,当中学生可以自由选择 AI 工具和用法时,他们的作业交得更快、分数更高,然而闭卷考试成绩却下滑了。换句话说,学生用AI做作业,可能没有真正掌握知识。这个结论虽然并不算出人意料,但反映出的问题却必须慎重对待。
作业变好了,考试却更差
2026 年 6 月,三位研究者发布了一篇工作论文,名叫《生成式人工智能的学习惩罚:来自中国中等教育的证据》。研究对象是中国中部一个 100 多万人口的县,包括当地 5 所初中、4 所高中,共 26811 名初一到高三学生,约占全县中学生的 90%。研究者取得了最长 30 个月的校内闭卷月考成绩、周末作业分数和作业平台记录,还取得了一部分学生的县统考及中高考成绩[2]。
数据来自文献[2]丨由经济学人重制,编者汉化
2025 年 6 月,学生接受调查,并回忆自己第一次使用生成式 AI 的月份。截至调查时,约 80% 的学生报告使用过 AI,常用工具包括豆包、DeepSeek、ChatGLM、文心一言和通义千问。在使用 AI 的学科中,数学最常见,其次是英语。
研究者用的是一种叫“双重差分法”的统计方法。大概可以这样理解:原来李雷和韩梅梅的成绩走势很接近。从某个月起,李雷开始用 AI 写作业,韩梅梅没有。那么,如果李雷的成绩曲线从这时候开始明显偏离了原来的轨道,而韩梅梅仍然按原来的走势发展,那么这段额外的偏离就可能与 AI 有关。放大到两万多名学生的规模,研究者比较的正是这种“用 AI 前后的变化”与“没用 AI 的同龄人同期变化”之间的差距。
这个方法比单纯的“用 AI 前和用 AI 后”的对比更可靠,但仍然不是随机实验。学生是自己决定什么时候开始用 AI 的,而如果“开始用 AI”这件事本身和其他同时发生的变化有关——比如某个阶段学习动力下降,或者是“因为跟不上进度,才想着找 AI 帮忙”——那么这些因素带来的成绩变化都可能被算在 AI 的账上。研究者用了长达 30 个月的连续月考数据去检查两组学生在用 AI 之前的走势是否确实接近,这能在一定程度上降低这种风险。
研究结果显示,在使用 AI 六到十个月后,差距就已经很明显了。周末作业分数平均提高约 18%;每次作业从领取到提交的时间,平均从约 64 分钟缩短到 45 分钟;与此同时,校内闭卷月考平均成绩下降了约 20%。
论文还报告了中考和高考结果。在累计使用 AI 至少两年的学生中,中考成绩约下降 24%,高考成绩约下降 18%。不过,因为这些数据只有很少几个结果时点,证据比较弱。
论文还发现,自由使用 AI 带来的学习损失在不同学科和性别间并不均匀。政治和地理等社会科学类科目的损失最大,其次是理科,语文和英语等语言类相对较小;按性别看,男生的降幅比女生更明显。这可能说明,AI 导致的成绩下降和具体学科的作业形式,以及不同群体使用 AI 的方式有关。
研究者注意到,一部分学生从领取作业到提交作业所用的时间很短,得分却很高,而随后的闭卷考试成绩又比较低。作者按照行为特征分类,把作业完成时间少于 50 分钟的叫做“外包”,少于 45 分钟叫做“完全外包”。按这种行为分类,使用 AI 超过五个月的学生中,81% 被归入“外包”组,50% 被归入“完全外包”组。
学习损失也主要集中在这些“外包”和“完全外包”组上。那些即使用了 AI、但完成作业的时间仍然和不用 AI 的同学相近的学生,学习损失很小。换句话说,问题似乎不只在于“用没用 AI”,还在于 AI 有没有替代学生自己的尝试和思考。
人们常把 AI 看成一种能力杠杆,以为它会让强者更强。但至少在这项研究中,结果恰恰相反:原来成绩较高的学生,估算出的成绩降幅反而更大。
图库版权图片,转载使用可能引发版权纠纷
研究者按照学生尚未使用 AI 时的平均考试成绩,把他们从低到高平均分成三组。论文估算,开始使用 AI 六到十个月后,原来成绩排在前 1/3 的学生,月考成绩下降约 24%;原来排在后 1/3 的学生,下降约 16%。把中考和高考合并估算后,两组的降幅分别约为 18% 和 11%。
研究者还发现,自称每周使用 AI 不足一小时的学生,月考成绩估计下降约 5%;自称使用五小时以上者下降约 30%。初中生的成绩降幅也比高中生更大。
不过需要注意,这是一项观察性研究,研究对象也局限于一个县。学生何时开始使用 AI 的数据来自事后回忆,可能存在误差;论文中的百分比是统计模型估算的平均变化,而不是每名学生都会出现的固定降幅。
AI 究竟替学生做了哪一步
虽然数字很吓人,但仅凭这项研究,并不能推出“只要使用 AI,中学生就一定学得更差”。毕竟,同样是使用 AI,实际发生的事情可能完全不同。
让 AI 查找一个数据、调整文档格式,是使用;让 AI 检查自己的答案、指出遗漏和错误,也是使用;要求 AI 提示一个难懂概念、换一种方式讲解,仍然是使用;让模型生成解题步骤、写好作文,直接交出可以复制粘贴的成品,也叫使用。
一种更有用的分类方法,是看 AI 在作业中扮演什么角色。它可以是资料助手,帮助搜索、整理和排版。它也可以是编辑,评价学生已经完成的答案。它还可以是导师,只给提示、追问和反馈。AI 可以是共同作者,和学生讨论不同方案。但 AI 也可以是枪手,从理解题目到生成答案全部包办,留给学生的任务只剩提交。
因此,与其问学生有没有用 AI,不如继续问:是在动笔前就索要答案,还是做完以后请 AI 检查?AI 给的是完整成品,还是继续思考的提示?关掉 AI 以后,能不能解释答案,再独立完成一道相似的题目?
最后一个问题尤其重要。关掉 AI 后还能够解释、重做和举一反三,才是学习的重要证据。前面的数据与“助手、编辑、导师”式使用和“枪手”式使用的区别相一致,虽然使用了 AI 但作业完成时间没有明显变化的学生,学习损失很小。
异种嵌合技术登场
今天的通用 AI 很擅长快速组织答案,但作业的目的不只是得到答案。学生先尝试、发现自己的薄弱点,再寻找办法、检查错误并重新完成,这些步骤构成了学习过程。
学习科学早就区分了“表现”和“学习”。表现是做当前任务时的速度、正确率和流畅度;学习则是比较持久的变化——过一段时间还能想起来,换一道题还能做出来。更顺畅地完成作业,不一定意味着真正掌握知识;而有些练习虽然在当时更困难,但以后留下的东西反而更多[3]。
学生自己不一定能察觉这种差别。AI 把答案直接放到屏幕上以后,“眼前已经有答案”很容易被误认为“我已经会了”。
可以把一次学习粗略地看成回路:先尝试,找到自己卡住的地方;复习或搜索,得到一个暂时答案;再验证、发现错误,修改自己的理解;最后重新做一遍。
而 AI 可以在每一步给提示、出反例、检查错误,也可以直接跳到终点,交出完整成品。如果学生放弃自己尝试,那么答案不会变成学生自己的能力。看懂一道数学题的解答,并不等于合上屏幕后还能做出来。
宽泛地讲,学习的目的是让我们形成一些知识框架和基础信息,能够提出一个好问题,能把新信息放进已有框架中,能看出错误和不合理之处,以及能做出良好的决策。要形成这些能力,学习者需要反复回忆、理解、判断、纠错和迁移。如果 AI 直接越过这些环节交出答案,学生就失去了形成能力所需的练习。
当然,学习的关键从来不是“动脑越累越好”,无意义的重复也不会因为痛苦就自动变成有效学习。学习的重点是通过获取和理解新信息而改变大脑加工能力。卡住、犯错、检查和重做,正是这些加工能力的改进过程。
这是学习过程中的必要摩擦,而这些摩擦必然不会愉快。所以容易理解,如果评价只看结果而不看过程,最省力的使用方式——使用 AI 做作业——就会更受学生欢迎。
那么,是否应该一刀切,彻底禁止 AI 进学校呢?
这恐怕也不是个好答案。在教师规定用法、安排练习并检查学生是否真正掌握的实验中,AI 确实可能帮助学习。
一项综述分析了 2022 至 2024 年间发表的 69 篇 ChatGPT 相关实验研究,发现平均效果为正[4];另一项聚焦“批判性思维、创造力、问题解决”等高阶思维能力的三层元分析,综合了 19 项实验研究,也得到中等程度的正面结果[5]。不过,这些研究大多持续时间较短,以大学生样本居多,不同研究之间的结果差异也很大。
这两项研究和之前我们看到的那篇论文都是成立的。两者回答的问题并不相同:一个问“精心设计的 AI 教学干预有没有用”,一个问“让学生自由使用 AI 会发生什么”。
AI 既能辅助教学,也能代做作业。区别不在于工具,而在于学生是否自己尝试、判断和纠错。
以后总能用 AI
为什么还要闭卷考试?
如果一份作业只要求从公开材料中拼装格式固定的文字,那么作业设计显然有问题。禁止使用 AI,也不会让这样的机械劳动变成有效学习。
但由此得出“以后总能使用 AI,现在就不必练习独立完成”,又走得太远了。即使使用 AI,人也要拥有判断问题是什么、答案大概应当是什么样,以及哪里必须检查的能力。
学校和职场对一项任务的要求并不相同。工作任务要求成品按时交付且质量合格;而学校布置一道题目,则是希望学生在做题过程中更熟练地掌握方法。
职场里常说 AI 会让“强者更强”。一位资深人士可以把重复步骤交给 AI,把精力投入到检查和取舍上;而一个新人如果把同样的工作交给 AI,却会失去学习的机会。
所以,AI 时代的教育需要把两类任务分开:一些任务可以允许学生与 AI 一起完成,用来练习提问、选择和核验;另一些任务需要不使用 AI,用来判断学生是否掌握了所需的知识和方法。
可以用三个问题作判断:
1. 这项任务首先要求尽快交付成品,还是要求学生学会一种以后要独立使用的方法?
2. AI 替代的是搜索、排版等辅助劳动,还是本应由学生完成的设计、分析、判断和纠错?
3. 不使用 AI 时,学生能不能解释、重做,并把所学用到一道稍有变化的新题上?
落实到一次具体学习中,可以先让学生独立尝试,写下自己卡住的地方;遇到困难后,再让 AI 提示、追问、举反例或指出错误,而不是直接交出成品;最后关闭 AI,由学生重新解释、独立完成,再尝试一道变式题。这样,AI 提供了认知支架和反馈,而不是替学生踏过整条学习回路。
美国康涅狄格州的柴郡学院正在做类似尝试。一名法语教师会让学生先用 AI 修改作业,再逐条检查哪些地方确实改对了,哪些虽然变得更“标准”,却抹掉了自己的表达。AI 只给出修改意见,学生仍然要自己判断[6]。
这家学校还给不同作业标上“交通灯”:绿灯允许充分使用 AI,红灯禁止使用,黄灯则由教师确定哪些工具和步骤可以交给 AI。例如,一份作业可以允许使用 AI 做拼写检查,却不允许直接问聊天机器人。这种方式也许可以给我们一些启示:学生开始做作业前就知道,当前任务是在练习人机协作,还是在检验自己能否独立完成[6]。
中国《中小学生成式人工智能使用指南(2025年版)》已经提出分学段、以人为本和避免过度依赖,明确不应把生成内容简单复制为作业,也不能把 AI 作为替代性教学主体。这与上述判断大体一致[7]。
进入职场以后,使用 AI 的理由会更加充分,但人仍然需要知道什么时候可以委托,什么时候必须接过判断权。一项针对管理咨询顾问的实验发现,在模型擅长的创意、分析和写作任务中,AI 可以让参与者完成得更快、更好;换成表面相似但模型不擅长的任务,使用 AI 的人反而更容易答错。研究者把这种忽高忽低的能力边界称为“锯齿状技术前沿”。能判断什么时候可以相信 AI,成了重要的能力[8]。
因此,学校不能只培养一种与工具隔绝的考试能力。没有 AI 时,学生应当能够回忆、解释、判断,并把学过的方法用到新问题上;有 AI 时,学生还要会提出问题、交叉核验、发现 AI 的错误或幻觉,并为最终答案负责。
AI 可以参与作业,但不能让学习者完全不做作业。判断 AI 是否真正帮助了学习,应该看在不使用 AI 工具以后,学生还会做些什么。作业成绩和完成速度无法证明是否真正学会,只有关掉 AI 之后,才见分晓。
参考文献
[1] 孙宏艳. 调查发现超六成受访中小学生用过 AI[N]. 中国青年报, 2026-03-26(08).
[2] Strömberg D, Lei V, Wu Y. The Generative AI Learning Penalty: Evidence from Chinese Secondary Education[R]. CEPR Discussion Paper No. DP21577, 2026-06-02.
[3] Soderstrom N C, Bjork R A. Learning Versus Performance: An Integrative Review[J]. Perspectives on Psychological Science, 2015, 10(2): 176-190.
[4] Deng R, Jiang M, Yu X, Lu Y, Liu S. Does ChatGPT Enhance Student Learning? A Systematic Review and Meta-analysis of Experimental Studies[J]. Computers & Education, 2025, 227: 105224.
[5] Liu X, Guo B, He W, Hu X. Effects of Generative Artificial Intelligence on K-12 and Higher Education Students' Learning Outcomes: A Meta-Analysis[J]. Journal of Educational Computing Research, 2025, 63(6): 1460-1492.
[6] Hall P, Santos R. How to Encourage Smarter AI Use in the Classroom[EB/OL]. MIT Technology Review, 2026-08-24. https://www.technologyreview.com/2026/08/24/1142630/ai-school-classroom-policies/
[7] 教育部基础教育教学指导委员会. 中小学生成式人工智能使用指南(2025年版)[Z]. 2025-05-13.
[8] Dell'Acqua F, Mollick E, Lifshitz-Assaf H, et al. Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of Artificial Intelligence on Knowledge Worker Productivity and Quality[J]. Organization Science, 2025.
热门跟贴