Co se stane, když velký jazykový model nikdy neuvidí látku za pátou třídu? Tým sedmi výzkumníků na tuto otázku odpověděl doslovně: postavili LittleLearner, LLM s 5 miliardami parametrů, trénovaný od nuly na korpusu filtrovaném podle kurikula základních škol v USA, a poté testovali, zda něco – více parametrů, více po tréninku, chytřejší výzvy – dokáže posunout model za hranice toho, co ho naučila jeho předtréninková data. Odpověď, hlásí, zní ne.

Příspěvek „LittleLearner: Language Models Under Pedagogically-Controlled Knowledge Exposure“ předložili arXiv 13. srpna Fanfei Li, Jana Zeller, Manuel Prada-Corral, Thaddäus Wiedemer, Prasanna Mayilvahanan, Ryan Cotterell a Wieland Brendel. Do 16. srpna to bylo předmětem rychle rostoucí diskuse Hacker News s více než 200 hlasy pro, když výzkumníci a praktici diskutovali o tom, co to znamená pro oblíbený předpoklad tohoto odvětví – že po školení lze vykouzlit schopnosti z ničeho. Je to přesně ten druh opatrného, ​​protikladného experimentu, který sledujeme v našem pokrytí výzkumu AI.

Pískoviště s hranicí znalostí

Moderní LLM jsou vyškoleni v podstatě na všechno, což téměř znemožňuje určit, zda se prokázaná dovednost skutečně naučila během školení, nebo byla pouze vyvolána správnou výzvou. Řešením týmu bylo omezit samotnou distribuci školení. Počínaje FineWeb-Edu destilovali korpus s 88 miliardami tokenů – nazvaný LittleCurriculum – prostřednictvím pětistupňového filtračního potrubí přizpůsobeného standardům Common Core pro mateřskou školu až do 5. ročníku. Pojmy, fakta a slovní zásoba vyučovaná v 5. ročníku byly výslovně vyloučeny.

Na tomto korpusu trénovali modely ve třech měřítcích (parametry 0,6B, 1,3B a 5B) od nuly, každý byl dodán spolu se shodným řídicím modelem trénovaným na nefiltrovaných datech se stejnou architekturou a rozpočtem tokenů. Výsledkem je model, který je dostatečně plynulý pro hodnocení s otevřeným koncem – můžete chatovat s hostovanou verzí 5B v prohlížeči – a přesto má ostrou, interpretovatelnou hranici znalostí: pokud to nebylo v základním kurikulu, model to nikdy neviděl.

Vyvolání, ne akvizice

Základní zjištění je přímočaré: standardní sada nástrojů pro chytřejší modely umocnila to, co už LittleLearner věděl, ale žádný z nich významně nezlepšil výkon mimo rozsah.

Škálování zlepšilo přesnost v rámci řízených znalostí modelu a rozšířilo se skromně podél stejné trajektorie učení, ale nedělalo nic pro problémy vyžadující schopnosti přesahující materiál třídy 5. Potrénink s GRPO – metoda posílení-učení stojící za velkou částí rozmachu modelů uvažování – významně posílila schopnosti K-5 v rozsahu, ale nedokázala obnovit schopnosti za K-5, i když byla trénována s daty mimo rozsah. A učení v kontextu, každodenní kouzlo nacpání znalostí do výzvy, pomohlo modelu použít to, co měl, ale neodemklo nové uvažování za hranicemi.

Předtréninkový filtr zkrátka nastavuje strop efektivních schopností. Autoři koncipují výsledek jako důkaz rozdílu, který se pole neustále stírá: po tréninku a pobízení vyvolávají; předtrénink získává.

Čisté ovládání, veřejné kontrolní body

Metodika je to, co dává tvrzením jejich sílu. Protože se každý model LittleLearner dodává s odpovídajícím nefiltrovaným ovládacím prvkem – stejnou architekturou, stejným počtem tokenů, stejným tréninkovým receptem – tým může jakýkoli rozdíl v chování připsat samotnému filtru kurikula. Specialisté na matematiku proškolení na benchmark MathCAMPS umožňují výzkumníkům hodnotit výkon podle školních tříd a přesně sledovat, kde končí schopnosti v rozsahu. A na rozdíl od většiny hraničních novin je vše veřejné: korpus, základna a následně vyškolené kontrolní body na všech třech škálách na HuggingFace a hostované demo chatu, takže nezávislé týmy mohou samy zkoumat hranice.

Tato otevřenost podněcuje debatu o Hacker News. Komentátoři testovali chování hostovaného modelu na hranici znalostí – ať už abstinuje, odhaduje nebo má halucinace, když překročí 5. ročník – a dohadují se o důsledcích: někteří považují výsledky za špatnou zprávu pro humbuk s modelem uvažování, jiní poukazují na to, že předtréninková data na webu obsahují mnohem více než koncepty základní školy, takže hraniční modely mají odpovídající vyšší stropy. Sami autoři článku jsou v tomto ohledu opatrní: jejich tvrzení se týká toho, co standardní intervence nemohly udělat pro model se známým, kontrolovaným vzděláním, nikoli přímou předpověď o hraničních laboratořích.

Proč na tom záleží mimo učebnu

Experiment přímo promlouvá do živých debat v AI. Laboratoře umělé inteligence utrácejí miliardy za režimy po tréninku založené na myšlence, že učení se posilováním může posunout základní model daleko za jeho hrubé schopnosti. LittleLearner naznačuje, že tyto zisky mohou z velké části žít v rámci – a být omezeny – tím, co podporují údaje o předtréninku. To je argument pro to, abychom se mnohem více starali o správu dat a abychom s tvrzeními o „naléhavých“ post-tréninkových schopnostech zacházeli skepticky.

Vydání je také skutečným výzkumným nástrojem, nikoli pouze papírem. Tým otevřeně zveřejnil LittleCurriculum a všechny kontrolní body modelu a stránka projektu načrtává experimenty, které sandbox umožňuje: zda může RL skutečně vytvářet schopnosti, spíše než je odměňovat, jak efektivně se model učí skutečně nový koncept, jako jsou záporná čísla, když je zaveden, a zda stroje a děti potřebují podobnou expozici – nebo dělají podobné chyby – když se učí zlomky.

Pro obor, který málokdy získá čisté kontroly, je model s výslovně specifikovaným vzděláním vzácný dar. A pro všechny ostatní je to připomenutí, které stojí za to si připnout nad stůl: žádný model – ani člověk – se nedokáže vymanit z toho, co se nikdy neučil.

Udržujte si náskok před AI

Denně poskytované zpravodajství o výzkumu přetvářející AI na úrovni vzájemného hodnocení. Uložte si naše centrum do záložek pro nejnovější vývoj AI.

Přečtěte si další zprávy o AI →