Einer der ehrgeizigsten Praxistests für KI-Nachhilfe hat ein ernüchterndes Urteil geliefert. Eine zweijährige, Cluster-randomisierte Studie mit dem Khanmigo-Lehrer der Khan Academy an 18 Mittelschulen in Tennessee ergab, dass der Zugang zum KI-Lehrer messbare, aber bescheidene Fortschritte in der Mathematik mit sich brachte und dass die Ergebnisse durch ein Problem gebremst wurden, das Technologen selten anpreisen: Die meisten Schüler nutzten ihn kaum. Die Studie mit dem Titel „One Click Away: AI Tutoring with Khanmigo in a Two-Year School Experiment“ wurde von Philip Oreopoulos und Nina Low durchgeführt und über die EdWorkingPapers-Reihe des Annenberg Institute an der Brown University veröffentlicht.

Die Ergebnisse sind weit über ein einzelnes Produkt hinaus von Bedeutung, denn Khanmigo ist einer der am weitesten verbreiteten KI-Nachhilfelehrer an amerikanischen Schulen und die Studie gehört zu den ersten groß angelegten experimentellen Auswertungen generativer KI-Nachhilfe unter normalen Unterrichtsbedingungen. Für jeden, der KI-Forschungsnachrichten und ihre Kollision mit realen Institutionen verfolgt, ist das Papier ein seltenes Stück stichhaltiger Beweise in einer Debatte, die von Marketingbehauptungen dominiert wird, und es landete diese Woche auf der Titelseite von Hacker News, als Pädagogen und Technologen seine Auswirkungen analysierten.

Was die Studie ergab

Im Rahmen der Studie wurden Schüler in 18 Mittelschulen in Tennessee nach dem Zufallsprinzip dazu aufgefordert, die Khan Academy mit ihrem KI-Lehrer Khanmigo während bestehender täglicher Mathematik-Förderstunden zu nutzen. Entscheidend war, dass der Tutor so konfiguriert war, dass er eher coachte als Antworten gab, was die erklärte Pädagogik der Khan Academy widerspiegelte. Das Experiment lief über zwei Schuljahre und ist damit eines der bislang längsten Feldexperimente zum KI-Nachhilfeunterricht.

Die wichtigsten Ergebnisse: Die Zuordnung zur KI-Nachhilfebedingung erhöhte die Mathematikleistungen um 1,3 nationale Perzentilränge pro Trimester, was den Autoren zufolge etwa 0,06 bis 0,08 Standardabweichungen über ein Schuljahr entspricht. Der implizite Effekt eines ganzen Jahres aktiver Teilnahme erreicht 0,14 Standardabweichungen. Das sind echte, statistisch nachweisbare Gewinne, und für einen kostengünstigen Softwareeingriff sind sie respektabel.

Aber der Vergleich, der den Hype entschärft, ist dieser: Die Gewinne ähneln denen aus der Praxis der Khan Academy ohne KI-Unterstützung. Studenten, die die vorhandenen Übungstools der Plattform ohne angeschlossenen KI-Lehrer nutzten, scheinen in etwa genauso gut abgeschnitten zu haben wie Studenten, die Zugang zu Khanmigo hatten.

Das Engagement-Problem in den Daten

Der aufschlussreichste Abschnitt des Papiers ist der forensische Bericht über die Verwendung. Oberflächlich betrachtet scheint die Akzeptanz stark zu sein: 96 Prozent der Studenten haben Khanmigo mindestens einmal ausprobiert. Darunter bricht das Engagement zusammen. Der durchschnittliche Schüler schrieb dem Nachhilfelehrer nur an etwa einem Drittel der Tage, an denen er Mathe übte, und nur in 17 Prozent der Übungsstunden, in denen er einen Fehler machte. Wenn die Schüler dem Tutor eine Nachricht schickten, stellten die Autoren fest, dass es sich bei den Nachrichten meist um bloße Antworten oder Klicks auf vorgeschlagene Eingabeaufforderungen handelte und nicht um einen inhaltlichen mathematischen Dialog.

Mit anderen Worten: Der Tutor war darauf eingestellt, Studenten sokratisch durch Fehler zu coachen, aber die Studenten mieden das Coaching-Gespräch größtenteils vollständig. Die Autoren kommen zu dem Schluss, dass die verbindliche Einschränkung offenbar das Engagement ist: Um das Versprechen von KI-Nachhilfe zu verwirklichen, müssen die Schüler dazu gebracht werden, sie zu nutzen, und nicht nur, ihnen Zugang zu gewähren.

Warum es für Schulen wichtig ist, KI zu kaufen

Bezirke in den Vereinigten Staaten stehen unter dem Druck, KI-Tools einzuführen, und Nachhilfe ist in fast jedem Pitch der wichtigste Anwendungsfall. Generative KI wird als die Technologie angepriesen, die endlich das verwirklichen könnte, was Bildungsforscher den Zwei-Sigma-Traum nennen: einen persönlichen Nachhilfelehrer für jeden Schüler. Die Two-Sigma-Formulierung von Bloom stammt aus älteren Untersuchungen zum menschlichen Nachhilfeunterricht und ist genau das Versprechen, gegen das KI-Nachhilfelehrer vermarktet werden.

Diese Studie legt nahe, dass der Engpass nicht in der Modellqualität oder dem Zugang liegt. Jeder Schüler in der Behandlungsgruppe hatte einen hochmodernen LLM-Nachhilfelehrer nur einen Klick entfernt und kostenlos in seinem täglichen Mathematikblock. Die Einschränkung bestand darin, ob Jugendliche in einer Förderklasse Tag für Tag freiwillig einen Nachhilfedialog führen würden. Menschliche Nachhilfe funktioniert zum Teil deshalb, weil die Person merkt, wenn man sich zurückzieht. Bisher kann die Software diesen Zug nicht zuverlässig reproduzieren.

Vorbehalte, die es zu beachten gilt

Bei dem Aufsatz handelt es sich um ein EdWorkingPaper, das über das Annenberg Institute der Brown University vertrieben wird, und die Leser sollten ihn als Arbeitsforschung und nicht als von Experten begutachtete Ergebnisse betrachten. Die Studie deckt Mittelschul-Fördermathematik in einem Staat ab, daher ist eine Verallgemeinerung auf andere Fächer, Klassenstufen oder Umsetzungsmodelle spekulativ. Der eigene Rahmen der Autoren wird gemessen: Sie berichten, was passierte, als ein weithin verfügbarer KI-Lehrer in bestehende Übungseinheiten integriert wurde, und nicht, was unter anderen Lehrplänen oder stärkeren Anreizen zum Engagement passieren könnte.

Es ist auch erwähnenswert, was die Studie nicht sagt. Es wird nicht festgestellt, dass KI-Nachhilfe nutzlos ist; Ein Standardabweichungseffekt von 0,14 aus einem ganzen Jahr aktiver Teilnahme wäre sinnvoll, wenn das Engagement aufrechterhalten werden könnte. Das Ergebnis liegt näher daran: Die Technologie funktionierte genauso gut wie die Nicht-KI-Übungstools, an die sie angeschlossen war, weil die Schüler die KI nicht anders nutzten als die Tasten, die sie bereits ignoriert hatten.

Das Essen zum Mitnehmen

Der Bildungstechnologiesektor hat zwei Jahre lang versprochen, dass generative KI-Lehrer die Klassenzimmer verändern werden. Dieser Versuch, einer der ersten, bei dem echte Schüler über zwei volle Jahre hinweg begleitet wurden, legt nahe, dass die Transformation durch ein uraltes Problem gesteuert wird: Kinder dazu zu bringen, die Arbeit machen zu wollen. Für Schulleiter besteht die Lektion darin, von KI-Anbietern Engagement-Daten und nicht nur Lizenzzahlen zu verlangen. Für die KI-Branche ist es eine Erinnerung daran, dass die größten Probleme bei der KI-Bereitstellung selten das Modell betreffen.

Bleiben Sie mit der KI-Forschung auf dem Laufenden

Feldexperimente wie dieses durchbrechen den Hype-Zyklus schneller als jeder Benchmark. Für eine kontinuierliche Berichterstattung über die KI-Forschung mit realen Konsequenzen verfolgen Sie die KI-Nachrichten auf aibuzzwire.news.

Weitere KI-Neuigkeiten lesen →