Unul dintre cele mai ambițioase teste din lumea reală de tutorare AI a dat un verdict serios. Un studiu randomizat de doi ani a profesorului Khanmigo al Academiei Khan în 18 școli gimnaziale din Tennessee a constatat că accesul la tutorele AI a produs câștiguri măsurabile, dar modeste la matematică și că rezultatele au fost oprite de o problemă pe care tehnologii o reclamă rar: majoritatea studenților abia l-au folosit. Studiul, intitulat „One Click Away: AI Tutoring with Khanmigo in a Two-Year School Experiment”, a fost realizat de Philip Oreopoulos și Nina Low și publicat prin intermediul Institutului Annenberg din seria EdWorkingPapers a Universității Brown.
Descoperirile contează mult dincolo de un singur produs, deoarece Khanmigo este unul dintre cei mai răspândiți tutori AI în școlile americane, iar studiul se numără printre primele evaluări experimentale la scară largă ale îndrumării AI generative în condiții normale de clasă. Pentru oricine urmărește știrile de cercetare AI și coliziunea sa cu instituțiile din lumea reală, lucrarea este o dovadă rară într-o dezbatere dominată de afirmații de marketing și a ajuns pe prima pagină a Hacker News în această săptămână, în timp ce educatorii și tehnologii i-au analizat implicațiile.
Ce a descoperit studiul
Studiul a repartizat aleatoriu elevilor din 18 școli gimnaziale din Tennessee să folosească Khan Academy cu profesorul său de AI Khanmigo în timpul sesiunilor zilnice de matematică de remediere existente. În mod crucial, tutorele a fost configurat să antreneze mai degrabă decât să dea răspunsuri, reflectând pedagogia declarată a Academiei Khan. Experimentul s-a desfășurat timp de doi ani de școală, făcându-l unul dintre cele mai lungi experimente de teren despre instruirea AI până în prezent.
Rezultatele principale: atribuirea la condiția de tutorare AI a crescut rezultatele la matematică cu 1,3 ranguri percentile naționale pe trimestru, pe care autorii le calculează ca fiind aproximativ 0,06 până la 0,08 abateri standard pe parcursul unui an școlar. Efectul implicit al unui an întreg de participare activă ajunge la 0,14 abateri standard. Acestea sunt câștiguri reale, detectabile statistic, iar pentru o intervenție software cu costuri reduse sunt respectabile.
Dar comparația care dezumflă hype este aceasta: câștigurile seamănă cu cele din practica Khan Academy fără asistență AI. Studenții care au folosit instrumentele de practică existente ale platformei, fără tutore AI atașat, par să fi făcut la fel de bine ca studenții care au avut acces la Khanmigo.
Problema de implicare în date
Secțiunea cea mai revelatoare a lucrării este raportul său criminalistic al utilizării. La suprafață, adopția pare puternică: 96% dintre studenți au încercat Khanmigo cel puțin o dată. Dedesubt, logodna se prăbușește. Elevul median i-a trimis un mesaj tutore doar în aproximativ o treime din zilele în care a exersat matematica și în doar 17 la sută din sesiunile de exerciții în care au făcut o greșeală. Când elevii au trimis un mesaj tutorelui, autorii au descoperit că mesajele erau în mare parte răspunsuri simple sau clicuri pe sugestii sugerate, mai degrabă decât dialog matematic substanțial.
Cu alte cuvinte, tutorele a fost configurat pentru a instrui socratic elevii prin greșeli, dar studenții au evitat în mare parte conversația de coaching. Autorii ajung la concluzia că constrângerea obligatorie pare să fie implicarea: realizarea promisiunii de tutorat AI va necesita ca studenții să o folosească, nu doar să le acorde acces.
De ce contează pentru școli care cumpără IA
Districtele din Statele Unite sunt sub presiune pentru a adopta instrumente AI, iar tutoratul este cazul de utilizare emblematic în aproape fiecare prezentare. Inteligența artificială generativă a fost promovată ca tehnologia care ar putea oferi în sfârșit ceea ce cercetătorii din domeniul educației numesc visul două sigma: un tutor personal pentru fiecare student. Încadrarea de două sigma a lui Bloom provine din cercetări mai vechi despre îndrumarea umană și este exact promisiunea față de care sunt comercializați tutorii AI.
Acest studiu sugerează că blocajul nu este calitatea modelului sau accesul. Fiecare student din grupul de tratament a avut un tutor LLM de ultimă generație, la un clic distanță, fără costuri, în blocul lor zilnic de matematică. Constrângerea a fost dacă adolescenții vor susține în mod voluntar un dialog de îndrumare, zi după zi, într-o clasă de remediere. Îndrumarea umană funcționează parțial pentru că o persoană observă când te deconectezi. Software-ul, până în prezent, nu reproduce în mod fiabil această atracție.
Avertismente care merită reținute
Lucrarea este un EdWorkingPaper, distribuit prin Institutul Annenberg al Universității Brown, iar cititorii ar trebui să-l trateze ca o cercetare de lucru, mai degrabă decât rezultate revizuite de colegi. Studiul acoperă matematica de remediere a școlii gimnaziale într-o singură stare, astfel încât generalizarea la alte materii, niveluri de clasă sau modele de implementare este speculativă. Se măsoară încadrarea proprie a autorilor: ei raportează ce s-a întâmplat atunci când un tutor AI disponibil pe scară largă a fost stratificat pe sesiunile de practică existente, nu ceea ce s-ar putea întâmpla în cadrul unor programe diferite sau stimulente mai puternice de implicare.
De asemenea, este de remarcat ceea ce nu spune studiul. Nu consideră că îndrumarea AI este inutilă; un efect de abatere standard de 0,14 de la un an întreg de participare activă ar fi semnificativ dacă implicarea ar putea fi susținută. Descoperirea este mai aproape de asta: tehnologia a funcționat, precum și instrumentele de practică non-AI pe care a fost fixată, deoarece studenții nu au folosit AI diferit de butoanele pe care le ignorau deja.
The Takeaway
Sectorul tehnologiei educației a petrecut doi ani promițând că tutorii generativi de inteligență artificială vor transforma sălile de clasă. Acest proces, unul dintre primii care urmărește studenți reali pe parcursul a doi ani întregi, sugerează că transformarea este determinată de o problemă străveche: a-i face pe copii să vrea să facă treaba. Pentru liderii de școală, lecția este să ceară date de implicare, nu doar numărul de licențe, de la furnizorii de AI. Pentru industria AI, este un memento că cele mai grele probleme în implementarea AI sunt rareori legate de model.
Fii la curent cu cercetarea AI
Experimentele de teren ca acesta trec prin ciclul de hype mai repede decât orice punct de referință. Pentru o acoperire continuă a cercetării AI cu consecințe în lumea reală, urmăriți știrile AI pe aibuzzwire.news.
Citiți mai multe știri AI →