一项最雄心勃勃的人工智能辅导现实测试得出了一个发人深省的结论。对可汗学院的 Khanmigo 导师在田纳西州 18 所中学进行的一项为期两年的整群随机试验发现,使用 AI 导师产生了可测量但适度的数学收益,但结果却因技术专家很少宣传的问题而受到阻碍:大多数学生几乎不使用它。这项研究题为“一键点击:在为期两年的学校实验中使用 Khanmigo 进行人工智能辅导”,由 Philip Oreopoulos 和 Nina Low 进行,并通过布朗大学安纳伯格研究所的 EdWorkingPapers 系列发表。
这些发现的重要性远远超出了单一产品的范围,因为 Khanmigo 是美国学校中部署最广泛的人工智能辅导老师之一,而且这项研究是在正常课堂条件下对生成式人工智能辅导进行的首次大规模实验评估之一。对于任何关注人工智能研究新闻及其与现实世界机构的冲突的人来说,这篇论文是一场由营销主张主导的辩论中罕见的确凿证据,并且在教育工作者和技术专家解析其含义时,它于本周登上了《黑客新闻》的头版。
研究发现
该试验随机分配田纳西州 18 所中学的学生在现有的日常数学补习课程中使用可汗学院及其人工智能导师 Khanmigo。至关重要的是,导师被配置为指导而不是给出答案,这反映了可汗学院的既定教学法。该实验持续了两个学年,是迄今为止最长的人工智能辅导现场实验之一。
主要结果是:人工智能辅导条件的分配使每学期的数学成绩在全国百分位数排名中提高了 1.3 个百分点,作者计算出每个学年的标准差约为 0.06 至 0.08 个标准差。全年积极参与的隐含效应达到 0.14 个标准差。这些都是真实的、统计上可检测到的收益,对于低成本的软件干预来说,它们是值得尊敬的。
但平息炒作的比较是这样的:收益类似于可汗学院在没有人工智能帮助的情况下进行的实践。使用该平台现有练习工具且没有人工智能导师的学生的表现似乎与使用 Khanmigo 的学生一样好。
数据中的参与度问题
这篇论文中最具启发性的部分是其对使用情况的司法解释。从表面上看,采用率看起来很高:96% 的学生至少尝试过 Khanmigo 一次。在底层,参与度崩溃了。中位学生在数学练习中只有大约三分之一的时间向导师发送了信息,并且只有 17% 的练习中出现了错误。当学生给导师发消息时,作者发现这些消息大多是简单的答案或点击建议提示,而不是实质性的数学对话。
换句话说,导师被配置为苏格拉底式地指导学生纠正错误,但学生大多完全避免指导对话。作者得出的结论是,约束性约束似乎是参与:实现人工智能辅导的承诺需要让学生使用它,而不仅仅是给他们访问权。
为什么学校购买人工智能很重要
美国各地都面临着采用人工智能工具的压力,而辅导几乎是每个领域的旗舰用例。生成式人工智能被宣传为一种最终可以实现教育研究人员所说的二西格码梦想的技术:为每个学生提供私人导师。布鲁姆的二西格玛框架来自于人类辅导的较早研究,而这正是人工智能辅导的营销承诺。
这项研究表明瓶颈不是模型质量或访问。治疗组中的每个学生都可以在日常数学模块中免费获得一位最先进的法学硕士导师。限制因素是青少年是否会自愿在辅导班上日复一日地维持辅导对话。人工辅导之所以有效,部分原因是当你脱离时,人们会注意到。到目前为止,软件还不能可靠地复制这种拉力。
值得牢记的注意事项
该论文是一份 EdWorkingPaper,通过布朗大学安纳伯格研究所分发,读者应将其视为工作研究而不是同行评审的发现。该研究涵盖一个州的中学数学补习,因此推广到其他科目、年级水平或实施模型都是推测性的。作者自己的框架是经过衡量的:他们报告了当广泛使用的人工智能导师分层到现有练习课程中时发生的情况,而不是在不同课程或更强的参与激励下可能发生的情况。
值得注意的是该研究没有说明什么。并不是发现AI辅导毫无用处;如果参与能够持续,那么全年积极参与的 0.14 标准差效应将是有意义的。研究结果更接近这一点:这项技术以及它所附加的非人工智能练习工具都发挥了作用,因为学生使用人工智能的方式与他们已经忽略的按钮没有什么不同。
要点
教育技术行业花了两年的时间承诺生成式人工智能导师将改变课堂。这项试验是首批对真实学生进行为期两年的跟踪试验之一,它表明这种转变是由一个古老的问题所决定的:让孩子们愿意做这项工作。对于学校领导来说,教训是要求人工智能供应商提供参与数据,而不仅仅是许可证数量。对于人工智能行业来说,这提醒我们,人工智能部署中最困难的问题很少与模型有关。
跟上人工智能研究的步伐
像这样的现场实验比任何基准测试都更快地突破了炒作周期。要持续报道人工智能研究及其对现实世界的影响,请关注 aibuzzwire.news 上的人工智能新闻。
阅读更多人工智能新闻 →