Uno dei test più ambiziosi nel mondo reale sul tutoraggio dell’intelligenza artificiale ha emesso un verdetto che fa riflettere. Uno studio randomizzato di due anni sul tutor Khanmigo della Khan Academy in 18 scuole medie del Tennessee ha scoperto che l’accesso al tutor dell’intelligenza artificiale ha prodotto guadagni in matematica misurabili ma modesti e che i risultati sono stati ostacolati da un problema che gli esperti di tecnologia raramente pubblicizzano: la maggior parte degli studenti lo usava a malapena. Lo studio, intitolato "One Click Away: AI Tutoring with Khanmigo in a Two-Year School Experiment", è stato condotto da Philip Oreopoulos e Nina Low e pubblicato attraverso la serie EdWorkingPapers dell'Annenberg Institute della Brown University.
I risultati contano ben oltre un singolo prodotto, perché Khanmigo è uno dei tutor di intelligenza artificiale più ampiamente utilizzati nelle scuole americane e lo studio è tra le prime valutazioni sperimentali su larga scala del tutoraggio di intelligenza artificiale generativa in normali condizioni di classe. Per chiunque segua le notizie sulla ricerca sull’intelligenza artificiale e la sua collisione con le istituzioni del mondo reale, il documento è un raro elemento di prova concreta in un dibattito dominato da affermazioni di marketing, ed è finito sulla prima pagina di Hacker News questa settimana mentre educatori e tecnologi ne analizzavano le implicazioni.
Cosa ha scoperto lo studio
Lo studio ha assegnato in modo casuale gli studenti di 18 scuole medie del Tennessee a utilizzare la Khan Academy con il suo tutor di intelligenza artificiale Khanmigo durante le sessioni quotidiane di matematica di recupero. Fondamentalmente, il tutor è stato configurato per istruire piuttosto che per fornire risposte, riflettendo la pedagogia dichiarata della Khan Academy. L’esperimento è durato due anni scolastici, rendendolo uno degli esperimenti sul campo più lunghi finora sul tutoraggio dell’intelligenza artificiale.
I risultati principali: l’assegnazione alla condizione di tutoraggio dell’intelligenza artificiale ha aumentato il rendimento in matematica di 1,3 gradi percentili nazionali per trimestre, che gli autori calcolano come circa 0,06-0,08 deviazioni standard nel corso di un anno scolastico. L'effetto implicito di un anno intero di partecipazione attiva raggiunge 0,14 deviazioni standard. Questi sono guadagni reali, rilevabili statisticamente e per un intervento software a basso costo sono rispettabili.
Ma il paragone che sgonfia l’hype è questo: i guadagni assomigliano a quelli della pratica della Khan Academy senza l’assistenza dell’intelligenza artificiale. Gli studenti che hanno utilizzato gli strumenti pratici esistenti della piattaforma, senza tutor di intelligenza artificiale, sembrano aver fatto altrettanto bene degli studenti che avevano accesso a Khanmigo.
Il problema del coinvolgimento nei dati
La sezione più rivelatrice del documento è il resoconto forense dell'utilizzo. A prima vista, l’adozione sembra forte: il 96% degli studenti ha provato Khanmigo almeno una volta. Sotto, l’impegno crolla. Lo studente medio ha inviato messaggi al tutor solo circa un terzo dei giorni in cui ha praticato matematica e solo nel 17% delle sessioni di esercizi in cui ha commesso un errore. Quando gli studenti hanno inviato messaggi al tutor, gli autori hanno scoperto che i messaggi erano per lo più semplici risposte o clic su suggerimenti suggeriti, piuttosto che un dialogo matematico sostanziale.
In altre parole, il tutor è stato configurato per istruire socraticamente gli studenti attraverso gli errori, ma gli studenti per lo più evitavano completamente la conversazione di coaching. Gli autori concludono che il vincolo vincolante sembra essere l’impegno: realizzare la promessa del tutoraggio dell’IA richiederà che gli studenti lo utilizzino, non solo concedergli l’accesso.
Perché è importante per le scuole acquistare l'intelligenza artificiale
I distretti di tutti gli Stati Uniti sono sotto pressione per adottare strumenti di intelligenza artificiale e il tutoraggio è il caso d’uso principale in quasi ogni campo. L’intelligenza artificiale generativa è stata promossa come la tecnologia che potrebbe finalmente realizzare quello che i ricercatori nel campo dell’istruzione chiamano il sogno due sigma: un tutor personale per ogni studente. L'inquadramento two-sigma di Bloom deriva da precedenti ricerche sul tutoraggio umano, ed è esattamente la promessa contro cui vengono commercializzati i tutor di intelligenza artificiale.
Questo studio suggerisce che il collo di bottiglia non è la qualità del modello o l’accesso. Ogni studente del gruppo di trattamento aveva un tutor LLM all'avanguardia a portata di clic, gratuitamente, all'interno del blocco di matematica quotidiano. Il vincolo era se gli adolescenti avrebbero sostenuto volontariamente un dialogo di tutoraggio, giorno dopo giorno, in una classe di recupero. Il tutoraggio umano funziona in parte perché una persona nota quando ti disimpegni. Il software, finora, non replica in modo affidabile questa spinta.
Avvertenze da tenere a mente
L'articolo è un EdWorkingPaper, distribuito attraverso l'Annenberg Institute della Brown University, e i lettori dovrebbero trattarlo come una ricerca operativa piuttosto che come risultati sottoposti a revisione paritaria. Lo studio riguarda la matematica di recupero della scuola media in uno stato, quindi generalizzare ad altre materie, livelli scolastici o modelli di implementazione è speculativo. L'inquadramento degli autori è misurato: riportano cosa è successo quando un tutor di intelligenza artificiale ampiamente disponibile è stato integrato in sessioni di pratica esistenti, non cosa potrebbe accadere con programmi di studio diversi o incentivi più forti al coinvolgimento.
Vale anche la pena notare ciò che lo studio non dice. Non ritiene che il tutoraggio dell’IA sia inutile; un effetto di deviazione standard di 0,14 derivante da un anno intero di partecipazione attiva sarebbe significativo se l’impegno potesse essere sostenuto. La scoperta è più vicina a questa: la tecnologia ha funzionato altrettanto bene degli strumenti pratici non basati sull’intelligenza artificiale su cui era fissata, perché gli studenti non hanno utilizzato l’intelligenza artificiale in modo diverso dai pulsanti che già ignoravano.
Il cibo da asporto
Il settore della tecnologia educativa ha trascorso due anni promettendo che i tutor dell’intelligenza artificiale generativa trasformeranno le aule. Questo studio, uno dei primi a seguire veri studenti per due anni interi, suggerisce che la trasformazione è legata a un antico problema: convincere i ragazzi a voler fare il lavoro. Per i dirigenti scolastici, la lezione è richiedere ai fornitori di intelligenza artificiale dati sul coinvolgimento, non solo il conteggio delle licenze. Per il settore dell’intelligenza artificiale, è un promemoria che i problemi più difficili nell’implementazione dell’intelligenza artificiale raramente riguardano il modello.
Tieni il passo con la ricerca sull'intelligenza artificiale
Esperimenti sul campo come questo tagliano il ciclo dell'hype più velocemente di qualsiasi benchmark. Per una copertura continua della ricerca sull'intelligenza artificiale con conseguenze nel mondo reale, segui le notizie sull'intelligenza artificiale su aibuzzwire.news.
Leggi altre notizie sull'AI →