Одне з наймасштабніших реальних випробувань навчання ШІ винесло витверезний вердикт. Дворічне кластерне рандомізоване дослідження репетитора Khanmigo від Khan Academy у 18 середніх школах штату Теннессі показало, що доступ до репетитора зі штучним інтелектом дає вимірні, але скромні переваги з математики, і що результати були стримані через проблему, яку технологи рідко рекламують: більшість учнів майже не користувалися ним. Дослідження під назвою «One Click Away: AI Tutoring with Khanmigo in a Two Year-Year School Experiment» було проведено Філіпом Ореопулосом і Ніною Лоу та опубліковано в серії EdWorkingPapers Інституту Анненберга при Університеті Брауна.

Отримані результати мають значення не лише для окремого продукту, оскільки Khanmigo є одним із найпоширеніших репетиторів ШІ в американських школах, а дослідження є одним із перших широкомасштабних експериментальних оцінок генеративного репетиторства ШІ в звичайних умовах у класі. Для всіх, хто стежить за [новинами дослідження штучного інтелекту] (https://aibuzzwire.news) та їх протиріччям з інституціями реального світу, стаття є рідкісним вагомим доказом у дискусії, де домінують маркетингові твердження, і цього тижня вона потрапила на першу сторінку Hacker News, коли педагоги та технологи аналізували її наслідки.

Що виявило дослідження

Випробування випадковим чином розподіляло учнів 18 середніх шкіл штату Теннессі для використання Академії Хана разом із репетитором зі штучним інтелектом Ханміго під час поточних щоденних занять з математики. Найважливіше те, що репетитор був налаштований на тренування, а не на надання відповідей, що віддзеркалювало заявлену педагогіку Академії Хана. Експеримент тривав два навчальні роки, що зробило його одним із найтриваліших польових експериментів із навчання ШІ на сьогодні.

Основні результати: призначення умови репетиторства ШІ підвищило досягнення з математики на 1,3 національного процентиля за семестр, що, як автори розраховують, становить приблизно від 0,06 до 0,08 стандартного відхилення протягом навчального року. Передбачуваний ефект повного року активної участі досягає 0,14 стандартного відхилення. Це реальні, статистично виявлені досягнення, і для недорогого програмного втручання вони гідні поваги.

Але порівняння, яке роздуває ажіотаж, полягає в наступному: досягнення нагадують результати практики Академії Хана без допомоги ШІ. Схоже, що студенти, які використовували наявні практичні інструменти платформи без наставника ШІ, робили це приблизно так само добре, як студенти, які мали доступ до Khanmigo.

Проблема залучення даних

Найбільш показовим розділом газети є його криміналістичний аналіз використання. На перший погляд, прийняття виглядає сильним: 96 відсотків студентів хоча б раз спробували Khanmigo. Під ним заручини руйнуються. Середній студент писав репетитору лише приблизно в третину днів, коли вони займалися математикою, і лише в 17 відсотках вправ, під час яких вони зробили помилку. Коли студенти відправляли репетитору повідомлення, автори виявили, що повідомлення були здебільшого простими відповідями або натисканням на запропоновані підказки, а не змістовним математичним діалогом.

Іншими словами, репетитор був налаштований на Сократівський інструктаж студентів через помилки, але студенти здебільшого повністю уникали коучинг-розмови. Автори приходять до висновку, що обов’язковим обмеженням, як видається, є залучення: реалізація перспектив навчання ШІ потребує змусити студентів використовувати його, а не просто надати їм доступ.

Чому школам важливо купувати ШІ

Райони по всій території Сполучених Штатів перебувають під тиском, щоб прийняти інструменти штучного інтелекту, і репетиторство є основним прикладом використання майже в кожному виступі. Генеративний штучний інтелект просувається як технологія, яка нарешті може реалізувати те, що дослідники освіти називають мрією двох сигм: персонального репетитора для кожного учня. Двосигма-фреймінг Блума походить від давніших досліджень людського репетиторства, і це саме та перспектива, проти якої продають репетиторів ШІ.

Це дослідження показує, що вузьким місцем є не якість моделі чи доступ. Кожен студент у групі лікування мав найсучаснішого репетитора LLM одним клацанням миші, безкоштовно, у своєму щоденному блоці математики. Обмеження полягало в тому, чи будуть підлітки добровільно підтримувати репетиторський діалог, день за днем, у виправному класі. Людське репетиторство працює частково тому, що людина помічає, коли ти відмовляєшся. Програмне забезпечення поки що не може надійно відтворити цю тягу.

Застереження, які варто мати на увазі

Стаття є EdWorkingPaper, розповсюдженою через Анненбергський інститут Університету Брауна, і читачі повинні сприймати її як робоче дослідження, а не рецензовані висновки. Дослідження охоплює додаткову математику в середній школі в одному штаті, тому узагальнення на інші предмети, рівні класів або моделі реалізації є спекулятивним. Вимірюється власний фрейм авторів: вони повідомляють про те, що трапилося, коли широко доступний репетитор зі штучного інтелекту був доданий до існуючих практичних занять, а не про те, що може статися за інших навчальних програм чи сильніших стимулів до участі.

Варто також відзначити те, про що не говорить дослідження. Він не вважає навчання ШІ марним; ефект стандартного відхилення 0,14 від повного року активної участі був би значущим, якщо б залученість була стійкою. Висновок ближче до цього: технологія працювала так само добре, як і практичні інструменти, не пов’язані зі штучним інтелектом, до яких вона була прикріплена, оскільки студенти не використовували штучний інтелект інакше, ніж ті кнопки, які вони вже ігнорували.

Винос

Сектор освітніх технологій витратив два роки, обіцяючи, що генеративні репетитори штучного інтелекту перетворять класи. Це випробування, одне з перших, яке проводилося за реальними учнями протягом двох повних років, свідчить про те, що трансформація пов’язана з давньою проблемою: змусити дітей захотіти виконувати роботу. Урок керівників шкіл полягає в тому, щоб вимагати від постачальників штучного інтелекту дані про залучення, а не лише кількість ліцензій. Для індустрії штучного інтелекту це нагадування про те, що найскладніші проблеми при розгортанні штучного інтелекту рідко пов’язані з моделлю.

Слідкуйте за дослідженнями ШІ

Польові експерименти, подібні до цього, прорізають цикл ажіотажу швидше, ніж будь-який контрольний тест. Щоб постійно висвітлювати дослідження ШІ з реальними наслідками, слідкуйте за новинами ШІ на aibuzzwire.news.

Читати більше новин AI →