AI 個別指導に関する最も野心的な現実のテストの 1 つで、厳粛な評決が下されました。テネシー州の中学校 18 校を対象に、カーン アカデミーのカンミゴ家庭教師を対象とした 2 年間のクラスター無作為化試験では、AI 家庭教師を利用することで、目に見えるもののささやかな数学の向上が見られ、その結果は、技術者がめったに宣伝しない問題によって抑制されていることがわかりました。つまり、ほとんどの生徒が AI 家庭教師をほとんど使用していなかったということです。 「ワンクリックでできる:2年間の学校実験におけるカンミゴによるAI個別指導」と題されたこの研究は、フィリップ・オレオプロス氏とニーナ・ロウ氏によって実施され、ブラウン大学アネンバーグ研究所のEdWorkingPapersシリーズを通じて出版された。

Khanmigo はアメリカの学校で最も広く導入されている AI 家庭教師の 1 つであり、この研究は通常の教室環境での生成型 AI 家庭教師の最初の大規模実験評価の 1 つであるため、この結果は単一の製品をはるかに超えて重要です。 AI 研究ニュース と現実世界の機関との衝突を追跡している人にとって、この論文は、マーケティング上の主張が主流の議論における貴重な確かな証拠であり、教育者や技術者がその意味を解析する中、今週、ハッカー ニュースのトップページに掲載されました。

研究でわかったこと

この試験では、テネシー州の中学校 18 校の生徒が、既存の毎日の数学補習セッション中に、AI 家庭教師の Khanmigo とともにカーン アカデミーを利用するよう無作為に割り当てられました。重要なのは、カーンアカデミーが掲げる教育方針を反映して、家庭教師は答えを与えるのではなく指導するように構成されていたことだ。この実験は 2 学年にわたって実施され、これまでの AI 個別指導に関するフィールド実験としては最長の 1 つとなりました。

見出しの結果は、AI 個別指導条件への割り当てにより数学の成績が 1 学期ごとに全国パーセンタイル ランク 1.3 上昇したというもので、著者らはこれを 1 学年でおよそ 0.06 ~ 0.08 の標準偏差として計算しています。 1 年間積極的に参加した場合の暗黙の効果は、標準偏差 0.14 に達します。これらは統計的に検出可能な実際の利益であり、低コストのソフトウェア介入としては立派なものです。

しかし、誇大宣伝を和らげる比較は次のとおりです。この成果は、AI の支援なしでカーン アカデミーの実践で得られたものと似ています。 AI 講師を付けずにプラットフォームの既存の練習ツールを使用した生徒は、Khanmigo にアクセスした生徒とほぼ同じ成績を収めたようです。

データにおけるエンゲージメントの問題

この論文の最も明らかなセクションは、その使用法に関する法医学的な説明です。表面的には、採用の勢いは強いように見えます。学生の 96% が少なくとも 1 回は Khanmigo を試しました。その下で、エンゲージメントは崩壊します。中央値の生徒が家庭教師にメッセージを送ったのは、数学を練習した日の約 3 分の 1 だけであり、間違えた練習セッションのわずか 17% でした。学生が家庭教師にメッセージを送ったとき、著者らは、メッセージのほとんどが実質的な数学的な対話ではなく、単なる回答や提案されたプロンプトのクリックであることに気づきました。

言い換えれば、家庭教師は生徒の間違いをソクラテス的に指導するように設定されていたが、生徒のほとんどはコーチングの会話を完全に避けたということだ。著者らは、拘束力のある制約はエンゲージメントであると思われると結論付けています。AI 個別指導の可能性を実現するには、生徒にアクセスを与えるだけでなく、生徒にそれを使用してもらう必要があるということです。

学校にとって AI の購入が重要な理由

全米の学区は AI ツールの導入を迫られており、家庭教師はほぼすべての分野で主力のユースケースとなっています。生成 AI は、教育研究者が「ツーシグマの夢」と呼ぶもの、つまりすべての生徒に個人家庭教師を提供することを最終的に実現できるテクノロジーとして推進されています。ブルームの 2 シグマ フレーミングは、人間による家庭教師に関する古い研究に基づいており、まさに AI 家庭教師が売り込まれている約束と同じです。

この研究は、ボトルネックがモデルの品質やアクセスではないことを示唆しています。治療グループのすべての生徒は、毎日の数学ブロック内で、ワンクリックで最新の LLM 講師を無料で利用できました。制約は、青少年が補習授業で毎日、自発的に指導対話を続けるかどうかだった。人間による指導が機能するのは、あなたが離脱したときに相手が気づくからでもあります。今のところ、ソフトウェアはそのプルを確実に再現していません。

心に留めておくべき注意事項

この論文はブラウン大学アネンバーグ研究所を通じて配布される EdWorkingPaper であり、読者は査読された結果ではなく実用的な研究として扱う必要があります。この研究は、ある州の中学校の補習数学を対象としているため、他の教科、学年、または実施モデルに一般化することは推測の域を出ません。著者ら自身の枠組みが測定されています。彼らは、別のカリキュラムや参加するためのより強力なインセンティブの下で何が起こるかではなく、広く利用可能な AI 家庭教師を既存の練習セッションに重ね合わせたときに何が起こったかを報告しています。

研究では何が述べられていないのかにも注目する価値がある。 AI 家庭教師が役に立たないというわけではありません。エンゲージメントが維持できれば、1 年間の積極的な参加による 0.14 の標準偏差効果は意味のあるものになります。この発見はこれに近い。生徒たちはすでに無視していたボタンと異なる方法で AI を使用しなかったため、このテクノロジーは、それが組み込まれた非 AI 練習ツールと同様に機能した。

テイクアウト

教育テクノロジー部門は、生成型 AI 家庭教師が教室を変革すると 2 年を費やして約束してきました。この試験は、本物の学生を丸2年にわたって追跡した最初の試験の1つであり、その変化が、子どもたちにその仕事をやりたいと思わせるという古くからの問題によって制御されていることを示唆している。学校の指導者にとっての教訓は、ライセンス数だけでなくエンゲージメント データを AI ベンダーに要求することです。 AI 業界にとって、これは、AI 導入における最も困難な問題がモデルに関するものであることはほとんどないことを思い出させます。

AI 研究の最新情報を入手する

このような実地実験は、どのベンチマークよりも早く誇大宣伝サイクルを突破します。現実世界に影響を及ぼす AI 研究を継続的に報道するには、aibuzzwire.news で AI ニュースをフォローしてください。

AIニュースをもっと読む→