Apa sing kedadeyan nalika model basa gedhe ora tau ndeleng materi ngluwihi kelas lima? Tim pitung peneliti mangsuli pitakon kasebut kanthi harfiah: dheweke nggawe LittleLearner, LLM 5 milyar parameter sing dilatih saka awal ing korpus sing disaring menyang kurikulum sekolah dasar AS, lan banjur nyoba apa wae - parameter liyane, luwih akeh latihan pasca latihan, pituduh sing luwih pinter - bisa nyurung model kasebut liwat apa sing diwulangake data pretraining kasebut. Jawaban, padha laporan, ora.

Makalah, "LittleLearner: Language Models Under Pedagogically-Controlled Knowledge Exposure," dikirim menyang arXiv tanggal 13 Agustus dening Fanfei Li, Jana Zeller, Manuel Prada-Corral, Thaddäus Wiedemer, Prasanna Mayilvahanan, Ryan Cotterell, lan Wieland Brendel. Ing tanggal 16 Agustus, iki minangka topik diskusi Hacker News kanthi cepet kanthi luwih saka 200 upvotes, amarga peneliti lan praktisi debat apa tegese kanggo asumsi favorit industri - yen latihan pasca bisa nggawe kemampuan metu saka hawa tipis. Iki minangka eksperimen kontrarian sing ati-ati sing kita deleng ing [liputan riset AI] (https://aibuzzwire.news).

Kothak wedhi Kanthi Wates Kawruh

LLM modern dilatih babagan kabeh, sing meh ora bisa dingerteni manawa katrampilan sing dituduhake bener-bener disinaoni sajrone latihan utawa mung ditindakake kanthi pituduh sing bener. Solusi tim yaiku mbatesi distribusi latihan kasebut. Miwiti saka FineWeb-Edu, dheweke nyuling korpus 88 milyar token - diarani LittleCurriculum - liwat pipa panyaring limang tahap sing selaras karo standar Inti Umum kanggo taman kanak-kanak nganti kelas 5. Konsep, fakta, lan kosakata sing diwulangake ing ndhuwur kelas 5 ora kalebu.

Ing korpus iki, dheweke nglatih model ing telung skala (parameter 0.6B, 1.3B, lan 5B) saka awal, saben dikirim bebarengan karo model kontrol sing cocog sing dilatih ing data tanpa filter kanthi arsitektur lan anggaran token sing padha. Asil kasebut minangka model sing cukup lancar kanggo evaluasi mbukak - sampeyan bisa ngobrol karo versi 5B sing di-host ing browser - nanging nduweni wates kawruh sing cetha lan bisa diinterpretasi: yen ora ana ing kurikulum SD, model kasebut ora tau weruh.

Elicitation, Not Acquisition

Temuan inti ora jelas: toolkit standar kanggo nggawe model luwih pinter nggedhekake apa sing wis dingerteni LittleLearner, nanging ora ana sing bisa nambah kinerja sing ora ana gandhengane.

Scaling nambah akurasi ing kawruh kontrol model lan ditambahi modestly ing sadawane lintasan learning padha, nanging ora nindakake sethitik kanggo masalah mbutuhake kabisan ngluwihi kelas-5 materi. Post-training karo GRPO — metode penguatan-learning konco akeh saka boom model-nalar — Ngartekno ndongkrak ing ruang lingkup K-5 kabisan, nanging gagal kanggo mbalekake ngluwihi-K-5 kapabilitas sanajan dilatih karo out-of-skop data. Lan pembelajaran ing konteks, sihir saben dina kanggo ngisi kawruh dadi pituduh, mbantu model nggunakake apa sing ana nanging ora mbukak kunci penalaran anyar sing ngluwihi wates.

Filter pretraining, cendhak, nyetel langit-langit kemampuan sing efektif. Penulis nggawe asil minangka bukti kanggo mbedakake lapangan sing terus-terusan kabur: post-training lan prompting elicit; pretraining entuk.

Kontrol sing resik, Checkpoints Umum

Metodologi sing menehi klaim kekuwatane. Amarga saben model LittleLearner dikirim kanthi kontrol tanpa filter sing cocog - arsitektur sing padha, jumlah token sing padha, resep latihan sing padha - tim bisa ngubungake prabédan prilaku apa wae menyang filter kurikulum mung. Spesialis matematika sing wis dilatih ing pathokan MathCAMPS ngidini para peneliti menehi kinerja miturut kelas sekolah, nglacak persis ing ngendi kemampuan ing ruang lingkup rampung. Lan ora kaya umume kertas perbatasan, kabeh umum: korpus, markas lan pos-checkpoint sing wis dilatih ing kabeh telung skala ing HuggingFace, lan demo obrolan sing dadi tuan rumah, supaya tim independen bisa nyelidiki watese dhewe.

Keterbukaan kasebut nyebabake debat Warta Peretas. Komentator wis nguji prilaku model sing di-host ing pinggiran kawruh - apa ora abstain, guess, utawa hallucinates nalika di-push liwat kelas 5 - lan mbantah babagan implikasi: sawetara maca asil minangka warta ala kanggo hype model pertimbangan, liyane nuduhake yen data pretraining skala web ngemot luwih akeh tinimbang konsep sekolah dasar, saengga model sing luwih dhuwur. Penulis kertas kasebut dhewe ngati-ati babagan iki: pratelan kasebut yaiku babagan apa sing ora bisa ditindakake intervensi standar kanggo model kanthi pendhidhikan sing dikontrol, dudu prediksi langsung babagan laboratorium perbatasan.

Apa Iku Penting Ngluwihi Kelas

Eksperimen kasebut langsung ngomong babagan debat langsung ing AI. Laboratorium AI mbuwang milyaran kanggo rejimen pasca-latihan adhedhasar ide yen sinau penguatan bisa nyurung model dhasar sing ngluwihi kemampuan mentah. LittleLearner nyaranake keuntungan kasebut bisa uga ana ing njero - lan diwatesi - apa sing didhukung data pretraining. Iki minangka argumentasi kanggo luwih peduli babagan kurasi data, lan kanggo ngobati klaim kapabilitas pasca-latihan "muncul" kanthi skeptis.

Rilis uga minangka instrumen riset asli, ora mung kertas. Tim kasebut ngeculake LittleCurriculum lan kabeh checkpoints model kanthi terbuka, lan kaca proyek nggawe sketsa eksperimen kothak wedhi: apa RL pancen bisa nggawe kemampuan tinimbang menehi ganjaran, kepiye conto-efisien model sinau konsep sing bener-bener anyar kayata angka negatif nalika ditepangake, lan apa mesin lan bocah-bocah mbutuhake cahya sing padha - utawa nggawe kesalahan sing padha - nalika sinau fraksi.

Kanggo lapangan sing arang entuk kontrol sing resik, model kanthi pendhidhikan sing ditemtokake kanthi jelas minangka hadiah langka. Lan kanggo wong liya, iki minangka pangeling sing kudu diselehake ing ndhuwur meja: ora ana model - utawa wong - sing bisa nyalahake apa sing durung nate diwulangake.

Tetep Ahead saka AI

Jangkoan kelas peer-review saka riset reshaping AI, dikirim saben dina. Tetenger hub kita kanggo pangembangan AI paling anyar.

Waca liyane warta AI →