Что происходит, когда большая языковая модель никогда не видит материалов после пятого класса? Команда из семи исследователей ответила на этот вопрос буквально: они создали LittleLearner, LLM с 5 миллиардами параметров, обученный с нуля на корпусе, отфильтрованном по учебной программе начальной школы США, а затем проверили, может ли что-нибудь — больше параметров, больше постобучения, более умные подсказки — продвинуть модель дальше того, чему ее научили данные предварительного обучения. Ответ, как они сообщают, отрицательный.

Статья «Маленький ученик: языковые модели в условиях педагогически контролируемого раскрытия знаний» была представлена ​​arXiv 13 августа Фанфеем Ли, Яной Зеллер, Мануэлем Прада-Корралом, Таддаусом Видемером, Прасанной Майилвахананом, Райаном Коттереллом и Виландом Бренделем. К 16 августа это стало предметом быстро растущей дискуссии в Hacker News, получившей более 200 голосов «за», в то время как исследователи и практики обсуждали, что это значит для любимого предположения отрасли — о том, что постобучение может вызвать способности из воздуха. Это именно тот осторожный, противоположный эксперимент, который мы наблюдаем в нашем [освещении об исследованиях ИИ] (https://aibuzzwire.news).

Песочница с границей знаний

Современные LLM обучаются практически всему, что делает практически невозможным определить, действительно ли продемонстрированный навык был усвоен во время обучения или просто был вызван правильной подсказкой. Решением команды было ограничить само распределение обучения. Начиная с FineWeb-Edu, они очистили корпус из 88 миллиардов токенов, получивший название LittleCurriculum, через пятиступенчатый конвейер фильтрации, соответствующий стандартам Common Core для детей от детского сада до 5-го класса. Концепции, факты и словарный запас, изучаемые выше 5-го класса, были явно исключены.

В этом корпусе они с нуля обучили модели в трех масштабах (параметры 0,6B, 1,3B и 5B), каждая из которых поставляется вместе с соответствующей контрольной моделью, обученной на нефильтрованных данных с той же архитектурой и бюджетом токенов. В результате получается модель, которая достаточно свободна для открытой оценки (вы можете общаться с размещенной версией 5B в браузере), но при этом имеет четкую, интерпретируемую границу знаний: если этого не было в начальной учебной программе, модель никогда этого не видела.

Выявление, а не приобретение

Основной вывод довольно очевиден: стандартный набор инструментов для создания более умных моделей усилил то, что LittleLearner уже знал, но ни один из них существенно не улучшил производительность, выходящую за рамки рассмотрения.

Масштабирование повышало точность контролируемых знаний модели и незначительно распространялось по той же траектории обучения, но мало помогало в решении задач, требующих способностей, выходящих за рамки материала 5-го класса. Пост-обучение с помощью GRPO — метода обучения с подкреплением, лежащего в основе большей части бума моделей рассуждения — значительно улучшило способности K-5, но не смогло восстановить способности, выходящие за рамки K-5, даже при обучении с данными, выходящими за рамки охвата. А контекстное обучение, ежедневная магия помещения знаний в подсказку, помогло модели использовать то, что у нее было, но не открыло новые рассуждения, выходящие за рамки.

Короче говоря, фильтр предварительной подготовки устанавливает эффективный потолок возможностей. Авторы представляют результат как свидетельство различия, которое постоянно размывается: постобучение и подсказка; предтренировочная приобретает.

Чистый контроль, общественные контрольно-пропускные пункты

Именно методология придает утверждениям силу. Поскольку каждая модель LittleLearner поставляется с соответствующим нефильтрованным элементом управления — одинаковой архитектурой, одинаковым количеством токенов, одинаковым рецептом обучения — команда может объяснить любые поведенческие различия только фильтром учебной программы. Специалисты-математики, прошедшие обучение по тесту MathCAMPS, позволяют исследователям оценивать успеваемость по школьным классам, точно отслеживая, где заканчиваются изучаемые способности. И в отличие от большинства пограничных документов, в HuggingFace все открыто: корпус, база и постобученные контрольно-пропускные пункты во всех трех масштабах, а также размещенная демонстрация чата, поэтому независимые команды могут самостоятельно исследовать границу.

Эта открытость подогревает дебаты на Hacker News. Комментаторы тестировали поведение размещенной модели на грани ее знаний — воздерживается ли она, догадывается или галлюцинирует, когда ее переходят за пятый класс — и спорят о последствиях: некоторые считают результаты плохой новостью из-за ажиотажа вокруг модели рассуждения, другие отмечают, что данные предварительного обучения в веб-масштабе содержат гораздо больше, чем концепции начальной школы, поэтому потолки передовых моделей соответственно выше. Сами авторы статьи осторожны в этом вопросе: их утверждение касается того, чего стандартные вмешательства не могут сделать для модели с известным, контролируемым образованием, а не прямого прогноза относительно передовых лабораторий.

Почему это важно за пределами класса

Эксперимент напрямую связан с живыми дебатами в области ИИ. Лаборатории искусственного интеллекта тратят миллиарды на посттренировочные режимы, основанные на идее, что обучение с подкреплением может значительно расширить базовую модель за пределы ее первоначальных возможностей. LittleLearner предполагает, что эти достижения могут в значительной степени зависеть от того, что поддерживают данные предварительной подготовки, и ограничиваться ими. Это аргумент в пользу того, чтобы уделять больше внимания хранению данных и относиться к утверждениям о «новых» возможностях после обучения со скептицизмом.

Этот выпуск также является настоящим исследовательским инструментом, а не просто статьей. Команда открыто опубликовала LittleCurriculum и все контрольные точки модели, а на странице проекта представлены эксперименты, которые позволяет проводить песочница: может ли RL действительно создавать возможности, а не вознаграждать их, насколько эффективно модель изучает действительно новую концепцию, такую ​​​​как отрицательные числа, когда она вводится, и нужно ли машинам и детям одинаковое воздействие — или совершать одинаковые ошибки — при изучении дробей.

Для отрасли, в которой редко бывает четкий контроль, модель с четко определенным образованием является редким подарком. А для всех остальных это напоминание, которое стоит повесить над столом: ни одна модель — или человек — не может найти выход из того, чему их никогда не учили.

Будьте впереди ИИ

Рецензируемое освещение исследований, меняющих ИИ, публикуется ежедневно. Добавьте в закладки наш центр последних разработок в области искусственного интеллекта.

Читать больше новостей об искусственном интеллекте →