Що відбувається, коли велика мовна модель ніколи не бачить матеріал після п’ятого класу? Команда з семи дослідників відповіла на це запитання буквально: вони створили LittleLearner, LLM з 5 мільярдами параметрів, навчений з нуля на корпусі, відфільтрованому за програмою початкової школи США, а потім перевірили, чи може щось — більше параметрів, більше постнавчання, розумніші підказки — підштовхнути модель до того, чого навчили її дані попереднього навчання. Відповідь, як вони повідомляють, - ні.
Доповідь «LittleLearner: мовні моделі під впливом педагогічно контрольованого знання» була представлена в arXiv 13 серпня Фанфей Лі, Яною Целлер, Мануелем Прада-Корралом, Таддеусом Відемером, Прасанною Майілваханан, Раяном Коттереллом і Віландом Бренделем. До 16 серпня це стало предметом бурхливого обговорення в Hacker News з більш ніж 200 голосами «за», оскільки дослідники та практики обговорювали, що це означає для улюбленого припущення галузі — що післянавчання може створювати можливості з повітря. Це саме той вид ретельного, протилежного експерименту, який ми спостерігаємо в нашому [дослідженні ШІ] (https://aibuzzwire.news).
Пісочниця з кордоном знань
Сучасні магістратури навчаються практично всьому, що робить майже неможливим визначити, чи була продемонстрована навичка справді засвоєною під час навчання чи просто викликана правильною підказкою. Команда вирішила обмежити сам розподіл навчання. Починаючи з FineWeb-Edu, вони дистильували корпус із 88 мільярдів токенів — під назвою LittleCurriculum — через п’ятиступеневу систему фільтрації, узгоджену зі стандартами Common Core для дитячого садка до 5-го класу. Концепції, факти та лексика, які вивчаються після 5-го класу, були явно виключені.
На цьому корпусі вони навчили моделі в трьох масштабах (параметри 0,6B, 1,3B і 5B) з нуля, кожну з яких доставляли разом із відповідною моделлю керування, навченою на нефільтрованих даних з тією самою архітектурою та бюджетом маркерів. Результатом є модель, яка є достатньо вільною для відкритого оцінювання — ви можете спілкуватися з розміщеною версією 5B у браузері — але має чіткі межі знань, які можна інтерпретувати: якщо цього не було в початковій навчальній програмі, модель ніколи не бачила цього.
Виявлення, а не придбання
Основний висновок однозначний: стандартний набір інструментів для покращення моделей розширив те, що вже знав LittleLearner, але жоден із них не покращив продуктивність поза рамками.
Масштабування підвищило точність у межах контрольованих знань моделі та трохи розширило ту саму траєкторію навчання, але мало принесло користі для проблем, які вимагають можливостей, окрім матеріалу для 5-го класу. Постнавчання з GRPO — методом навчання з підкріпленням, що лежить в основі буму моделювання міркувань — значно підвищило здібності K-5 у межах K-5, але не вдалося відновити здібності за межами K-5, навіть якщо тренувалися з даними поза межами. А навчання в контексті, повсякденна магія запихання знань у підказку, допомогло моделі використати те, що вона мала, але не розблокувало нових міркувань за кордоном.Коротше кажучи, фільтр попереднього навчання встановлює ефективну межу можливостей. Автори оформляють результат як доказ відмінностей, які поле постійно розмивається: після навчання та спонукання; набуває попередньої підготовки.
Чистий контроль, громадські контрольно-пропускні пункти
Методологія – це те, що надає претензіям силу. Оскільки кожна модель LittleLearner постачається з відповідним нефільтрованим елементом керування — та сама архітектура, та сама кількість токенів, той самий рецепт навчання — команда може приписати будь-яку поведінкову різницю лише фільтру навчального плану. Фахівці з математики, які пройшли підготовку за тестом MathCAMPS, дозволяють дослідникам оцінювати успішність за оцінками в школі, відстежуючи, де саме закінчуються здібності в рамках дослідження. І на відміну від більшості прикордонних документів, усе є публічним: корпус, база та контрольно-пропускні пункти після підготовки на всіх трьох рівнях на HuggingFace, а також розміщена демонстрація чату, тож незалежні команди можуть досліджувати кордон самостійно.
Ця відкритість підживлює дебати в Hacker News. Коментатори перевіряли поведінку розміщеної моделі на межі знань — чи вона утримується, здогадується чи галюцинує, коли перевищує 5 клас — і сперечаються про наслідки: одні сприймають результати як погану новину для ажіотажу моделі міркування, інші вказують, що дані попереднього навчання в Інтернеті містять набагато більше, ніж поняття початкової школи, тому стелі передових моделей відповідно вищі. Самі автори статті обережні в цьому питанні: вони стверджують, що стандартні втручання не можуть зробити для моделі з відомою, контрольованою освітою, а не прямим прогнозом щодо прикордонних лабораторій.
Чому це важливо за межами класу
Експеримент безпосередньо говорить про живі дебати в ШІ. Лабораторії штучного інтелекту витрачають мільярди на схеми після тренувань, виходячи з ідеї, що навчання з підкріпленням може підштовхнути базову модель далеко за межі її сирих можливостей. LittleLearner припускає, що ці переваги можуть значною мірою залежати від того, що підтверджують дані перед навчанням, і бути обмеженими ними. Це є аргументом для того, щоб набагато більше піклуватися про курування даних і скептично ставитися до заяв про «виникаючі» можливості після навчання.
Реліз також є справжнім дослідницьким інструментом, а не просто документом. Команда відкрито опублікувала LittleCurriculum і всі контрольні точки моделі, а на сторінці проекту нарисовано експерименти, які дозволяє пісочниця: чи справді RL може створювати можливості, а не винагороджувати їх, наскільки ефективно модель вивчає справді нову концепцію, таку як від’ємні числа, коли її вводять, і чи потрібно машинам і дітям подібний вплив — або вони роблять подібні помилки — під час вивчення дробів.
Для сфери, яка рідко отримує чистий контроль, модель із чітко визначеною освітою є рідкісним даром. А для всіх інших це нагадування, яке варто прикріпити над столом: жодна модель — чи людина — не може обдумати свій вихід із того, чого їх ніколи не вчили.
Будьте попереду ШІ
Щоденне рецензування досліджень, що змінюють ШІ. Додайте наш центр у закладки для останніх розробок ШІ.
Читати більше новин AI →