Ett av de mest ambitiösa testerna av AI-handledning i verkligheten har gett en nykter dom. En tvåårig randomiserad klusterprövning av Khan Academys Khanmigo-handledare i 18 mellanskolor i Tennessee fann att tillgången till AI-handledaren gav mätbara men blygsamma matematikvinster, och att resultaten hölls tillbaka av ett problem som teknologer sällan annonserar om: de flesta elever använde det knappt. Studien, med titeln "One Click Away: AI Tutoring with Khanmigo in a Two-Year School Experiment," utfördes av Philip Oreopoulos och Nina Low och publicerades genom Annenberg Institute vid Brown Universitys EdWorkingPapers-serie.
Fynden har betydelse långt bortom en enskild produkt, eftersom Khanmigo är en av de mest utbredda AI-lärarna i amerikanska skolor och studien är bland de första storskaliga experimentella utvärderingarna av generativ AI-handledning under normala klassrumsförhållanden. För alla som spårar AI-forskningsnyheter och dess kollision med verkliga institutioner är tidningen ett sällsynt bevis i en debatt som domineras av marknadsföringspåståenden, och den landade på förstasidan av Hacker News den här veckan när utbildare och teknologer analyserade dess implikationer.
Vad studien fann
Försöket tilldelade slumpmässigt elever i 18 mellanskolor i Tennessee att använda Khan Academy med sin AI-lärare Khanmigo under befintliga dagliga korrigerande matematiksessioner. Det avgörande var att handledaren var konfigurerad att coacha snarare än att ge svar, vilket speglar Khan Academys uttalade pedagogik. Experimentet pågick i två skolår, vilket gör det till ett av de längsta fältexperimenten på AI-handledning hittills.
Rubrikresultaten: tilldelning till AI-handledningsvillkoret höjde matematikprestationerna med 1,3 nationella percentilrankningar per termin, vilket författarna beräknar som ungefär 0,06 till 0,08 standardavvikelser under ett läsår. Den implicita effekten av ett helt år av aktivt deltagande når 0,14 standardavvikelser. Det är verkliga, statistiskt detekterbara vinster, och för en låg kostnad mjukvaruintervention är de respektabla.
Men jämförelsen som sänker hypen är denna: vinsterna liknar de från Khan Academy-övningen utan AI-hjälp. Studenter som använde plattformens befintliga övningsverktyg, utan någon AI-handledare, verkar ha gjort det ungefär lika bra som elever som hade tillgång till Khanmigo.
Engagemangsproblemet i data
Tidningens mest avslöjande avsnitt är dess rättsmedicinska redogörelse för användningen. På ytan ser adoptionen stark ut: 96 procent av eleverna provade Khanmigo minst en gång. Därunder kollapsar engagemanget. Medianstudenten skickade ett meddelande till handledaren endast ungefär en tredjedel av dagarna som de tränade matematik, och i endast 17 procent av träningspassen där de gjorde ett misstag. När eleverna skickade ett meddelande till handledaren, fann författarna att meddelandena mestadels var bara svar eller klick på föreslagna uppmaningar, snarare än innehållsmässig matematisk dialog.
Med andra ord var handledaren konfigurerad att sokratiskt coacha elever genom misstag, men eleverna undvek för det mesta coachningssamtalet helt. Författarna drar slutsatsen att den bindande begränsningen verkar vara engagemang: att förverkliga löftet om AI-handledning kommer att kräva att eleverna använder det, inte bara ge dem åtkomst.
Varför det är viktigt för skolor som köper AI
Distrikt över hela USA är under press att ta till sig AI-verktyg, och handledning är flaggskeppet för användning i nästan varje pitch. Generativ AI har marknadsförts som tekniken som äntligen skulle kunna leverera vad utbildningsforskare kallar two-sigma-drömmen: en personlig handledare för varje student. The Blooms tvåsigma-inramning kommer från äldre forskning om mänsklig handledning, och det är precis det löfte som AI-lärare marknadsförs mot.
Denna studie tyder på att flaskhalsen inte är modellkvalitet eller tillgång. Varje student i behandlingsgruppen hade en toppmodern LLM-handledare ett klick bort, utan kostnad, i sitt dagliga matteblock. Begränsningen var huruvida ungdomar frivilligt skulle upprätthålla en handledningsdialog, dag efter dag, i en avhjälpande klass. Mänsklig handledning fungerar delvis för att en person märker när du kopplar ur. Mjukvara, än så länge, replikerar inte på ett tillförlitligt sätt denna dragning.
Varningar värda att tänka på
Tidningen är en EdWorkingPaper, distribuerad genom Brown Universitys Annenberg Institute, och läsare bör behandla den som arbetsforskning snarare än referentgranskade resultat. Studien täcker korrigerande matematik på mellanstadiet i ett tillstånd, så generalisering till andra ämnen, årskurser eller implementeringsmodeller är spekulativt. Författarnas egen inramning mäts: de rapporterar vad som hände när en allmänt tillgänglig AI-handledare lades på befintliga övningssessioner, inte vad som kan hända under olika läroplaner eller starkare incitament att engagera sig.
Det är också värt att notera vad studien inte säger. Den finner inte att AI-handledning är värdelös; en 0,14 standardavvikelseeffekt från ett helt år av aktivt deltagande skulle vara meningsfullt om engagemanget kunde upprätthållas. Upptäckten är närmare detta: tekniken fungerade lika bra som de icke-AI-övningsverktyg den var fastskruvad på, eftersom eleverna inte använde AI på ett annat sätt än de knappar som de redan ignorerat.
Takeaway
Utbildningstekniksektorn har tillbringat två år med att lova att generativa AI-lärare kommer att förvandla klassrum. Den här rättegången, en av de första som följde riktiga studenter under två hela år, tyder på att förvandlingen har ett uråldrigt problem: att få barn att vilja göra jobbet. För skolledare är lektionen att kräva engagemangsdata, inte bara antalet licenser, från AI-leverantörer. För AI-branschen är det en påminnelse om att de svåraste problemen med AI-utbyggnad sällan handlar om modellen.
Håll dig uppdaterad med AI-forskning
Fältexperiment som det här skär igenom hypecykeln snabbare än något riktmärke. För kontinuerlig bevakning av AI-forskning med verkliga konsekvenser, följ AI-nyheter på aibuzzwire.news.
Läs mer AI-nyheter →