Een van de meest ambitieuze tests van AI-begeleiding in de echte wereld heeft een ontnuchterend oordeel opgeleverd. Uit een twee jaar durend clustergerandomiseerd onderzoek met de Khan Migo-leraar van de Khan Academy op 18 middelbare scholen in Tennessee bleek dat de toegang tot de AI-leraar meetbare maar bescheiden wiskundewinst opleverde, en dat de resultaten werden tegengehouden door een probleem waar technologen zelden over adverteren: de meeste leerlingen gebruikten het nauwelijks. De studie, getiteld "One Click Away: AI Tutoring with Khanmigo in a Two-Year School Experiment", werd uitgevoerd door Philip Oreopoulos en Nina Low en gepubliceerd via het Annenberg Institute van de EdWorkingPapers-serie van Brown University.

De bevindingen zijn veel belangrijker dan een enkel product, omdat Khanmigo een van de meest ingezeten AI-docenten op Amerikaanse scholen is en het onderzoek een van de eerste grootschalige experimentele evaluaties is van generatieve AI-begeleiding in normale klasomstandigheden. Voor iedereen die AI-onderzoeksnieuws en de botsing ervan met echte instellingen volgt, is het artikel een zeldzaam stukje hard bewijs in een debat dat wordt gedomineerd door marketingclaims, en het belandde deze week op de voorpagina van Hacker News toen docenten en technologen de implicaties ervan analyseerden.

Wat de studie heeft gevonden

Bij de proef werden studenten op 18 middelbare scholen in Tennessee willekeurig toegewezen om de Khan Academy met haar AI-leraar Khanmigo te gebruiken tijdens bestaande dagelijkse herstelwiskundesessies. Cruciaal was dat de docent was geconfigureerd om te coachen in plaats van antwoorden te geven, wat de aangegeven pedagogie van de Khan Academy weerspiegelde. Het experiment duurde twee schooljaren en is daarmee een van de langste veldexperimenten op het gebied van AI-begeleiding tot nu toe.

De belangrijkste resultaten: toewijzing aan de AI-begeleidingsconditie verhoogde de wiskundeprestaties met 1,3 nationale percentielrangen per semester, wat de auteurs berekenen als ongeveer 0,06 tot 0,08 standaarddeviaties over een schooljaar. Het impliciete effect van een volledig jaar actieve deelname bedraagt ​​0,14 standaardafwijkingen. Dat zijn reële, statistisch waarneembare voordelen, en voor een goedkope software-interventie zijn ze respectabel.

Maar de vergelijking die de hype doet afnemen is deze: de winsten lijken op die van de Khan Academy-praktijk zonder AI-hulp. Studenten die de bestaande oefentools van het platform gebruikten, zonder dat er een AI-docent aan verbonden was, lijken het ongeveer net zo goed te hebben gedaan als studenten die toegang hadden tot Khanmigo.

Het betrokkenheidsprobleem in de gegevens

Het meest onthullende deel van de krant is het forensische verslag van het gebruik. Op het eerste gezicht lijkt de adoptie sterk: 96 procent van de studenten heeft Khanmigo minstens één keer geprobeerd. Daaronder stort de betrokkenheid in. De gemiddelde leerling stuurde slechts op ongeveer een derde van de dagen dat hij wiskunde oefende een bericht naar de docent, en in slechts 17 procent van de oefensessies maakte hij een fout. Toen studenten de docent een bericht stuurden, ontdekten de auteurs dat de berichten meestal kale antwoorden of klikken op voorgestelde aanwijzingen waren, in plaats van een inhoudelijke wiskundige dialoog.

Met andere woorden: de docent was geconfigureerd om studenten socratisch te begeleiden bij fouten, maar de studenten vermeden het coachingsgesprek meestal volledig. De auteurs concluderen dat de bindende beperking betrokkenheid lijkt te zijn: het realiseren van de belofte van AI-begeleiding vereist dat studenten er gebruik van maken, en niet alleen dat ze er toegang toe krijgen.

Waarom het belangrijk is voor scholen om AI te kopen

Districten in de Verenigde Staten staan onder druk om AI-tools te adopteren, en bijles is het belangrijkste gebruiksscenario in bijna elk veld. Generatieve AI is gepromoot als de technologie die eindelijk zou kunnen verwezenlijken wat onderwijsonderzoekers de two-sigma-droom noemen: een persoonlijke docent voor elke student. De twee-sigma-framing van Bloom komt voort uit ouder onderzoek naar menselijke begeleiding, en het is precies de belofte waartegen AI-docenten op de markt worden gebracht.

Deze studie suggereert dat het knelpunt niet de kwaliteit of toegang van het model is. Elke student in de behandelgroep had met één klik een ultramoderne LLM-leraar binnen hun dagelijkse wiskundeblok, gratis en met één klik verwijderd. De beperking was of adolescenten vrijwillig dag in dag uit een begeleidingsdialoog zouden voeren in een remediërende klas. Menselijke begeleiding werkt deels omdat iemand het merkt wanneer u zich terugtrekt. Software repliceert die aantrekkingskracht tot nu toe niet op betrouwbare wijze.

Waarschuwingen die het waard zijn om in gedachten te houden

Het artikel is een EdWorkingPaper, verspreid via het Annenberg Instituut van Brown University, en lezers moeten het beschouwen als werkend onderzoek in plaats van als peer-reviewed bevindingen. Het onderzoek heeft betrekking op herstelwiskunde op de middelbare school in één staat, dus generaliseren naar andere vakken, leerjaren of implementatiemodellen is speculatief. De eigen framing van de auteurs wordt gemeten: ze rapporteren wat er gebeurde toen een algemeen beschikbare AI-docent werd toegevoegd aan bestaande oefensessies, en niet wat er zou kunnen gebeuren onder andere curricula of sterkere prikkels om mee te doen.

Het is ook vermeldenswaard wat de studie niet zegt. Het vindt niet dat AI-begeleiding nutteloos is; een standaardafwijkingseffect van 0,14 ten opzichte van een volledig jaar actieve deelname zou zinvol zijn als de betrokkenheid duurzaam zou kunnen zijn. De bevinding ligt hier dichter bij: de technologie werkte net zo goed als de niet-AI-oefenhulpmiddelen waarop deze was gemonteerd, omdat leerlingen de AI niet anders gebruikten dan de knoppen die ze al negeerden.

De afhaalmaaltijd

De onderwijstechnologiesector belooft al twee jaar dat generatieve AI-docenten klaslokalen zullen transformeren. Deze proef, een van de eerste die echte studenten gedurende twee volle jaren volgde, suggereert dat de transformatie wordt ingeluid door een eeuwenoud probleem: ervoor zorgen dat kinderen het werk willen doen. Voor schoolleiders is de les om betrokkenheidsgegevens te eisen, en niet alleen het aantal licenties, van AI-leveranciers. Voor de AI-industrie herinnert het eraan dat de grootste problemen bij de inzet van AI zelden te maken hebben met het model.

Blijf op de hoogte van AI-onderzoek

Veldexperimenten als deze doorbreken de hype-cyclus sneller dan welke benchmark dan ook. Voor voortdurende berichtgeving over AI-onderzoek met gevolgen voor de praktijk, volg AI-nieuws op aibuzzwire.news.

Lees meer AI-nieuws →