Jeden z nejambicióznějších testů výuky umělé inteligence v reálném světě přinesl střízlivý verdikt. Dvouletý klastrový randomizovaný pokus učitele Khanmigo z Khan Academy napříč 18 středními školami v Tennessee zjistil, že přístup k učiteli umělé inteligence přinesl měřitelné, ale skromné ​​matematické zisky a že výsledky byly zadrženy problémem, který technologové jen zřídka inzerují: většina studentů jej téměř nepoužívala. Studii s názvem „One Click Away: AI Tutoring with Khanmigo in a Two-year School Experiment“ provedli Philip Oreopoulos a Nina Low a publikovali ji prostřednictvím série EdWorkingPapers Annenberg Institute na Brown University.

Na zjištěních záleží daleko za hranicemi jediného produktu, protože Khanmigo je jedním z nejrozšířenějších lektorů AI na amerických školách a studie patří mezi první rozsáhlé experimentální hodnocení generativního doučování AI v běžných podmínkách třídy. Pro každého, kdo sleduje zprávy o výzkumu AI a jejich kolizi s institucemi v reálném světě, je tento dokument vzácným důkazem v debatě ovládané marketingovými tvrzeními a tento týden se dostal na titulní stránku Hacker News, když pedagogové a technologové analyzovali jeho důsledky.

Co studie zjistila

Zkouška náhodně přidělila studentům 18 středních škol v Tennessee, aby používali Khan Academy se svým učitelem umělé inteligence Khanmigem během stávajících každodenních lekcí matematiky. Rozhodující je, že tutor byl nakonfigurován tak, aby spíše koučoval než odpovídal, což odráželo deklarovanou pedagogiku Khan Academy. Experiment probíhal dva školní roky, což z něj dělá jeden z nejdelších terénních experimentů s doučováním AI k dnešnímu dni.

Hlavní výsledky: přiřazení k podmínce doučování AI zvýšilo výsledky v matematice o 1,3 celostátního percentilu za semestr, což autoři vypočítají jako zhruba 0,06 až 0,08 standardní odchylky za školní rok. Implikovaný efekt celého roku aktivní účasti dosahuje 0,14 směrodatné odchylky. To jsou skutečné, statisticky zjistitelné zisky a za levný softwarový zásah jsou úctyhodné.

Ale srovnání, které šíří humbuk, je toto: zisky se podobají těm z praxe Khan Academy bez pomoci umělé inteligence. Zdá se, že studenti, kteří používali stávající cvičné nástroje platformy bez připojeného učitele umělé inteligence, zvládli stejně dobře jako studenti, kteří měli přístup ke Khanmigu.

Problém zapojení v datech

Nejobjevnější částí papíru je jeho forenzní popis použití. Na první pohled vypadá adopce silně: 96 procent studentů vyzkoušelo Khanmigo alespoň jednou. Pod ním se zapojení zhroutí. Střední student poslal lektorovi zprávu jen asi ve třetině dnů, kdy procvičovali matematiku, a pouze v 17 procentech cvičení, ve kterých udělali chybu. Když studenti poslali zprávu lektorovi, autoři zjistili, že zprávy byly většinou holé odpovědi nebo kliknutí na navrhované výzvy, spíše než věcný matematický dialog.

Jinými slovy, tutor byl nakonfigurován tak, aby Socratically koučoval studenty přes chyby, ale studenti se většinou úplně vyhýbali koučovacímu rozhovoru. Autoři dospěli k závěru, že závazným omezením se zdá být zapojení: realizace příslibu doučování umělé inteligence bude vyžadovat přimět studenty, aby je používali, nejen jim poskytnout přístup.

Proč je pro školy důležité nakupovat AI

Okresy po celých Spojených státech jsou pod tlakem, aby přijaly nástroje umělé inteligence, a doučování je vlajkovou lodí použití téměř na každém hřišti. Generativní umělá inteligence byla propagována jako technologie, která by mohla konečně přinést to, co výzkumní pracovníci ve vzdělávání nazývají sen dvou sigma: osobního učitele pro každého studenta. Rámování Bloom's two-sigma pochází ze staršího výzkumu lidského doučování a je to přesně ten slib, proti kterému jsou učitelé umělé inteligence uváděni na trh.

Tato studie naznačuje, že úzkým místem není kvalita modelu nebo přístup. Každý student v léčebné skupině měl v rámci svého denního matematického bloku k dispozici nejmodernějšího lektora LLM na jedno kliknutí zdarma. Omezením bylo, zda by adolescenti dobrovolně vedli doučovací dialog, den za dnem, v doučovací třídě. Lidské doučování funguje částečně proto, že si člověk všimne, když se odpoutáte. Software zatím tento tah spolehlivě nereplikuje.

Upozornění, která stojí za to mít na paměti

Tento článek je EdWorkingPaper, distribuovaný prostřednictvím Annenberg Institute Brown University a čtenáři by s ním měli zacházet spíše jako s pracovním výzkumem než jako recenzovaná zjištění. Studie pokrývá středoškolskou pomocnou matematiku v jednom státě, takže zobecnění na jiné předměty, úrovně ročníků nebo implementační modely je spekulativní. Měří se vlastní rámování autorů: uvádějí, co se stalo, když byl široce dostupný učitel umělé inteligence navrstven na stávající cvičební lekce, nikoli to, co by se mohlo stát v rámci jiných osnov nebo silnějších pobídek k zapojení.

Za povšimnutí stojí i to, co studie neříká. Nezjišťuje, že doučování AI je zbytečné; efekt směrodatné odchylky 0,14 z celého roku aktivní účasti by byl smysluplný, pokud by bylo možné angažovanost udržet. Zjištění je tomu blíže: technologie fungovala stejně dobře jako cvičné nástroje mimo AI, na které byla našroubována, protože studenti nepoužívali AI jinak než tlačítka, která již ignorovali.

Jídlo s sebou

Sektor vzdělávacích technologií dva roky sliboval, že generativní lektoři umělé inteligence promění učebny. Tato zkouška, jedna z prvních, která sledovala skutečné studenty po celé dva roky, naznačuje, že transformaci brání prastarý problém: přimět děti, aby tu práci chtěly dělat. Pro vedení škol je poučením vyžadovat od dodavatelů umělé inteligence data o zapojení, nejen počty licencí. Pro průmysl AI je to připomínka, že nejtěžší problémy při zavádění AI se jen zřídka týkají modelu.

Držte krok s výzkumem AI

Polní experimenty, jako je tento, protínají hype cyklus rychleji než jakýkoli benchmark. Pro nepřetržité pokrytí výzkumu AI s reálnými důsledky sledujte zprávy o AI na aibuzzwire.news.

Přečtěte si další zprávy o AI →