一项追踪中国约 27,000 名学生的新研究得出了关于生成式人工智能在教育领域的一些最发人深省的证据:使用人工智能工具的学生发现他们的家庭作业成绩跃升了 18%,完成作业的时间也少得多,然后在没有人工智能帮助的情况下进行的考试中,得分低于同学 20%。这项研究由斯德哥尔摩大学的 David Strömberg 与香港大学的 Victor Lei 和 Wu Yanhui 共同领导,8 月 18 日《经济学人》对其进行了重点报道,并作为工作论文在 SSRN 上流传。对于关注突发人工智能新闻的读者来说,这是一个教育工作者和家长不会轻易忽视的数据点。
设置和冲击
研究人员着手回答大多数学校一直在猜测的一个问题:人工智能是帮助学生学习,还是帮助他们完成学业?通过对数万名跨学科学生进行六个月的跟踪,该团队可以将人工智能用户和非用户的家庭作业表现与后续考试结果进行比较。
《经济学人》总结的主要调查结果是:六个月后,使用人工智能的学生发现所有科目的平均家庭作业成绩提高了 18%,而每项作业花费的时间从平均 64 分钟减少到 45 分钟。但当考试时间到来时,这些学生的成绩比从未使用人工智能做家庭作业的同学低了 20%。
更深层次的发现更加微妙和令人不安。 《经济学人》的分析指出:“家庭作业分数曾经预测考试成绩;现在,相反,那些得分最高的人更有可能在考试中表现更差。”换句话说,教师所依赖的传统信号——作业成绩作为理解程度的衡量指标——已经悄然被打破。作业看起来最好的学生可能是那些对材料理解最少的学生。
外包,而不是学习
为什么家庭作业成绩飙升而考试成绩却大幅下降?数据指出了研究人员所描述的外包:学生将工作本身交给模型,而不是将其用作导师。公开讨论中引用的论文数据表明,研究中大约 81% 的人工智能用户有效地将他们的作业委托给了语言模型——而且学生接触这些工具的时间越长,外包率就会越高。
模式逐渐显现。在研究初期,一些使用人工智能的学生在每项作业上花费的时间仍然超过 65 分钟——与非用户的时间大致相同——而且他们的作业和考试结果看起来与避免使用人工智能的同龄人相似。研究人员推断这些学生几乎没有使用这些模型。但在采用 6 个月后,接触 AI 的学生仍然花在家庭作业上的时间超过 65 分钟。最初的偶尔协助似乎逐渐演变成一项又一项的全面授权。
这种升级使得调查结果如此难以忽视。这并不是说人工智能辅导不起作用——如果有意识地使用,作为解释和测验的苏格拉底式伙伴,该技术显然可以帮助人们学习。在自然条件下,对于青少年和逾期的作业,阻力最小的路径直接贯穿答案。
为什么中国要做一个干净的测试用例
该研究的背景强化了其结论。在中国,大学录取是通过高风险的标准化考试进行的,家庭作业成绩不会像其他地方那样夸大课程成绩。考试是外部基准测试,结果极其残酷,这使得 20% 的差距很难用简单的评分或老师的宽大处理来解释。这项研究有效地隔离了研究人员关心的渠道:人工智能改变了作业的制作方式,考试衡量了实际学到的内容。
《黑客新闻》上对这篇论文的讨论收集了数百个观点,讨论了一个明显的后续问题——人工智能是否是一个“放大器”,可以让勤奋的学生变得更好,让不积极的学生变得更糟。该论文自己的分析推翻了这种令人欣慰的框架:时间使用数据表明,即使是开始负责任地使用人工智能的学生也会在几个月内转向授权,这意味着风险并不局限于那些从一开始就不想学习的人。
学校的政策困境
这一发现出现在一个尴尬的时刻。政府和教育科技公司竞相将人工智能导师带到学生面前,押注个性化人工智能帮助将缩小成绩差距。这项研究表明,在规模上,相反的结果是可能的:家庭作业变得毫无摩擦,成绩提高,而其之下的可衡量的学习却悄悄地被侵蚀——只有在为时已晚而无法修复时才发现。
对于学校来说,影响是具体的。如果家庭作业不再能作为学习的证据,评估必须在课堂上进行并进行监督。如果人工智能的使用不可避免,那么作业可能需要围绕该技术重新设计——口头答辩、课堂问题讨论,以及基于过程的评分,以奖励研究发现学生跳过的努力。如果外包随着曝光度的增加而加剧,那么延迟也不是中性的:每个月的非结构化人工智能访问似乎都会加深这种习惯。
研究人员的贡献是用纵向数字取代了 ChatGPT-in-the-classroom 时代的轶事恐慌,而且数字惨淡。以考试成绩下降 20% 为代价而获得的 18% 作业改进并不是学习收益,而是将作业从学生转移到机器上,并在考试当天支付利息。
保持人工智能领先地位
有关教育领域人工智能的研究突破、政策影响和诚实分析,请添加书签 AI Buzz Wire。
阅读更多人工智能新闻 →