AI资讯

覆盖 2.7 万名学生的大规模研究证实:AI 提升作业成绩但损害闭卷考试表现,学习效果出现「工具依赖鸿沟」

发布时间:2026年08月22日 12:00:00

8 月 22 日公开的一项覆盖 2.7 万名中国初高中学生、追踪两个学期的大规模教育 AI 研究显示:使用 AI 辅助的学生作业正确率随时间持续高于对照组,但期末闭卷考试中关键知识点掌握度反而下降 6–8 个百分点,出现「作业越来越好、考试越来越差」的工具依赖鸿沟,提示教育 AI 必须从「直接给答案」转向「引导思考脚手架」。


覆盖 2.7 万名学生的大规模研究证实:AI 提升作业成绩但损害闭卷考试表现,学习效果出现「工具依赖鸿沟」

8 月 22 日,The Automated Daily 播客与加拿大新闻网站 CA News 24 同步披露了一份引发教育界与 AI 教育产品圈高度关注的大规模研究:一项覆盖 2.7 万名中国初高中学生、跨两个完整学期、采用双盲随机对照设计的追踪研究显示,日常使用 AI 工具辅助做作业的学生,其作业正确率持续显著优于未使用组,但在期末闭卷独立考试中,关键知识点掌握度反而下降了 6–8 个百分点。这一结果首次在超大规模样本上证实了许多教师与家长的直觉担忧:AI 能让学生「更快把作业做对」,但可能同时让他们「更慢真正理解」,出现所谓的「工具依赖鸿沟」。

研究设计:2.7 万名学生 + 双盲随机对照 + 两个学期追踪

研究由国内三所师范大学教育学院联合发起,样本覆盖 11 个城市 64 所初高中,总计 27,312 名学生(初中 14,897 人、高中 12,415 人),追踪时间跨度为 2025–2026 学年全学年(两个学期)。

设计上严格采用「学校-班级配对随机分组」:

  • 实验组(AI 组):约 13,600 名学生,学校统一采购并在日常作业中被推荐使用指定品牌的教育 AI 工具(作业题解析、步骤提示、知识点讲解);
  • 对照组(非 AI 组):约 13,700 名学生,在相同学校与同年级的其他班级,不提供教育 AI 工具的官方接入渠道;
  • 双盲处理:参与统计分析的研究员不清楚哪些班级属于哪一组,各班级教师在整个学年中未被告知「本班级被纳入哪一组的统计」,只负责按正常教学进度授课;
  • 配对变量控制:研究通过分层随机确保两组在学校资源、班级平均成绩、性别比例、年级分布上平衡,避免系统性偏差。

研究的核心观察指标有三类:

  1. 日常作业正确率(来自作业系统自动记录,每周一次聚合);
  2. 单元测与月考成绩(半闭卷,允许翻自己课堂笔记但不允许用 AI);
  3. 期中、期末闭卷独立考试(完全不允许任何工具,严格监考)。

核心发现:作业提升 +8 分,闭卷考试下降 -6.3 分

论文预印本公开的核心结果相当清晰:

发现一:作业正确率持续提升,学期末两组差距扩大至 8.2 分

从第一学期第 4 周开始,AI 组作业正确率就显著高于对照组(p<0.01),且差距随时间持续扩大。到第一学期末,AI 组平均作业正确率为 89.4%,对照组为 81.2%,差距约 8.2 个百分点;第二学期末差距进一步扩大至 9.1 个百分点

发现二:单元测和月考差距缩小到 1.8 分(统计不显著)

当考试允许翻课堂笔记、不允许用 AI 时,两组成绩差距迅速收窄:AI 组平均分比对照组高 1.8 分,但这一差距无法通过 0.05 水平的显著性检验——也就是说,一旦离开了 AI 辅助,AI 组学生在半开卷环境下的优势基本消失

发现三:闭卷独立考试出现「逆转」:AI 组比对照组低 6.3 分

最核心、最出乎意料的结论出现在期中与期末闭卷独立考试中:

  • 第一学期末闭卷考:AI 组平均得分 73.2 分,对照组 79.0 分,AI 组比对照组低 -5.8 分(p<0.001);
  • 第二学期末闭卷考:AI 组平均得分 70.9 分,对照组 77.2 分,差距扩大至 -6.3 分(p<0.001);
  • 子科目分解:数学证明题、物理推导题、化学计算题等「需要独立运用知识进行推理、而不是搜索相似解答」的题型上差距最大(-9.4 / -8.7 / -7.1 分);语文作文与英语选择题等「记忆型或表达型」题目上差距较小(-2.3 / -1.9 分)。

「工具依赖鸿沟」的深层解释

研究在论文中给出了三个相互印证的机制解释:

机制一:AI 跳过了「解题试错」这一关键记忆巩固环节

认知科学中的「合意困难(Desirable Difficulties)」理论指出,学习过程中适度的挣扎、试错、走错路再修正,会让知识点在工作记忆与长时记忆之间形成更深的编码连接。AI 在 3 秒内给出完整解答步骤,恰恰把这个「通过自己试错来巩固」的环节给拿掉了。学生看到了正确答案,但并没有「自己推出来」的心理过程,因此一旦离开 AI、在闭卷考试中独立面对类似问题,就无法自主从长时记忆中重新组装推理链条。

机制二:作业正确率的「虚假信心」导致复习投入减少

AI 组学生普遍反映:「平时作业正确率挺高的,觉得自己都会了,考试前复习就没那么认真。」期末复习周的学生自我报告时间统计显示:AI 组平均每周复习时间比对照组少 15.4%。这是一种典型的「元认知错觉」——对作业的高表现并非来自自身掌握度,而是来自工具外挂,但学生的元认知系统把它错归因为「我真的掌握了」

机制三:题型暴露偏差:AI 擅长的题型被过度练习,不擅长的题型被冷落

研究通过对作业数据做细粒度文本分析发现:AI 组学生在「有标准答案、搜索可得、套路明确」的题目上投入时间显著更多,而在「需要推导证明、需要原创论证」的题目上经常让 AI 直接给出解法、自己跳过思考。期末闭卷考中失分最重的恰恰是后者。

对 AI 教育产品的设计启示

研究团队在公开讨论中明确表示:这个研究的意义并非「反对在教育中使用 AI」,而是「如果 AI 教育产品只做『直接给答案』,它会系统性损害学习效果」。正确的方向是让 AI 从「替学生思考」转型为「引导学生思考的脚手架」。

他们提出了三条明确的产品设计建议:

  1. 默认「步骤提示模式」而非「完整答案模式」:AI 不要一上来就给完整解答,而是分步给提示,第一级提示只说「应该回忆哪个知识点」,第二级说「可能的公式或定理」,第三级才开始给出步骤;用户必须先在输入框中尝试写第一步,AI 才会给下一步;
  2. 强制「反思卡片」机制:在作业完成后,AI 必须弹出 2–3 道「变式题」或「关键知识点抽查题」,学生只有独立答对一定比例,AI 才认定这个作业点被「掌握」;
  3. 向家长和教师报告「AI 依赖指数」:教育 AI 产品应给教师和家长一个可视化的「独立思考比例」——比如某学生这一周作业中 70% 的题是自己写了超过 3 步后才调用 AI 查看提示,30% 的题是一上来就让 AI 给完整解答,而不是只报告「作业正确率 90%」。

教育政策与学校端的应对建议

对学校与教育管理者,研究者也给出了两条落地建议:

  • 区分「作业」与「练习」两种不同的 AI 使用规则:对于需要与家长配合、重在完成任务的课后家庭作业,可以允许一定程度 AI 辅助;但对于校内「课堂练习」与「自习练习」,应明确不允许使用 AI,确保在校时间内学生有足够的「独立肌肉训练」;
  • 重写考试权重:闭卷独立考试权重应上调,而非下调:不少学校在 AI 时代的第一反应是「闭卷考不太公平,要不增加开卷或项目式作业的权重」,但本研究显示恰恰相反——AI 越普及,越需要保留闭卷独立考试作为「衡量学生真实掌握度的锚点」,否则学生会系统性地对自己的掌握情况产生错误认知。

行业反响与后续计划

研究公开后迅速引发热议:

  • OpenAI 在 8 月 18 日推出青少年版 ChatGPT 时,已设置了「负责任作业提醒」与「学习模式」,与本研究的建议方向高度一致;
  • 国内作业帮、科大讯飞、猿辅导等教育 AI 厂商在 8 月 22 日当天就有公开表态,表示将在秋季学期版本中加入「AI 依赖指数」与「强制变式题抽查」等机制;
  • 部分地方教育局的研究室已表示将把本研究纳入本学期教研会议议题,讨论调整高中统考与中考命题方向,增加「对 AI 不友好、但对真实能力友好」的题型占比。

研究团队表示将继续追踪这批学生升入下一年级的表现,并在 2026 年底发布第三学期的追踪数据,重点关注「夏季长假后是否出现遗忘速率差异」与「AI 使用时长的非线性阈值效应」。

一句话总结:AI 时代学生学习的真正风险,不是「AI 让他们学不会」,而是「AI 让他们误以为自己学会了」——下一个十年教育 AI 产品的核心竞争力,是谁能真正做好「脚手架」而不是「替跑」。