Apa yang berlaku apabila model bahasa yang besar tidak pernah melihat bahan melebihi gred lima? Sepasukan tujuh penyelidik menjawab soalan itu secara literal: mereka membina LittleLearner, LLM 5 bilion parameter yang dilatih dari awal pada korpus yang ditapis ke kurikulum sekolah rendah A.S., dan kemudian menguji sama ada apa-apa - lebih banyak parameter, lebih banyak latihan selepas latihan, gesaan yang lebih bijak - boleh menolak model itu daripada apa yang diajarkan oleh data pralatihannya. Jawapannya, mereka melaporkan, tidak.
Kertas kerja, "LittleLearner: Model Bahasa Di Bawah Pendedahan Pengetahuan yang Dikawal Secara Pedagogi," telah diserahkan kepada arXiv pada 13 Ogos oleh Fanfei Li, Jana Zeller, Manuel Prada-Corral, Thaddäus Wiedemer, Prasanna Mayilvahanan, Ryan Cotterell dan Wieland Brendel. Menjelang 16 Ogos ia menjadi subjek perbincangan Hacker News yang mendaki pantas dengan lebih daripada 200 undian naik, ketika penyelidik dan pengamal membahaskan maksudnya untuk andaian kegemaran industri — bahawa pasca latihan boleh menimbulkan keupayaan keluar dari udara tipis. Ini adalah jenis eksperimen yang berhati-hati dan bertentangan yang kami perhatikan dalam [liputan penyelidikan AI] kami (https://aibuzzwire.news).
Kotak Pasir Dengan Sempadan Pengetahuan
LLM moden dilatih pada asasnya tentang segala-galanya, yang menjadikannya hampir mustahil untuk mengetahui sama ada kemahiran yang ditunjukkan benar-benar dipelajari semasa latihan atau hanya ditimbulkan oleh gesaan yang betul. Penyelesaian pasukan adalah untuk mengekang pengedaran latihan itu sendiri. Bermula dari FineWeb-Edu, mereka menyaring korpus 88 bilion token — digelar LittleCurriculum — melalui saluran paip penapisan lima peringkat yang sejajar dengan piawaian Teras Biasa untuk tadika hingga gred 5. Konsep, fakta dan perbendaharaan kata yang diajar di atas gred 5 secara jelas dikecualikan.
Pada korpus ini, mereka melatih model pada tiga skala (parameter 0.6B, 1.3B dan 5B) dari awal, setiap satu dihantar bersama model kawalan dipadankan yang dilatih pada data tidak ditapis dengan seni bina dan belanjawan token yang sama. Hasilnya ialah model yang cukup fasih untuk penilaian terbuka — anda boleh bersembang dengan versi 5B yang dihoskan dalam penyemak imbas — namun mempunyai sempadan pengetahuan yang tajam dan boleh ditafsir: jika ia tiada dalam kurikulum asas, model itu tidak pernah melihatnya.
Pemberian, Bukan Pemerolehan
Penemuan teras adalah tumpul: kit alat standard untuk menjadikan model lebih pintar menguatkan perkara yang telah diketahui oleh LittleLearner, tetapi tiada satu pun daripadanya meningkatkan prestasi luar skop yang bermakna.
Penskalaan meningkatkan ketepatan dalam pengetahuan terkawal model dan dilanjutkan secara sederhana sepanjang trajektori pembelajaran yang sama, tetapi tidak banyak membantu masalah yang memerlukan keupayaan melebihi bahan gred-5. Selepas latihan dengan GRPO — kaedah pembelajaran pengukuhan di sebalik kebanyakan ledakan model penaakulan — meningkatkan kebolehan K-5 dalam skop dengan ketara, namun gagal memulihkan keupayaan melebihi K-5 walaupun dilatih dengan data di luar skop. Dan pembelajaran dalam konteks, keajaiban setiap hari untuk memasukkan pengetahuan ke dalam gesaan, membantu model menggunakan apa yang ada tetapi tidak membuka kunci penaakulan baharu di luar sempadan.Penapis pralatihan, secara ringkasnya, menetapkan siling keupayaan berkesan. Pengarang merangka hasilnya sebagai bukti perbezaan bidang yang sentiasa kabur: pasca latihan dan dorongan; pralatihan memperoleh.
Kawalan Bersih, Pusat Pemeriksaan Awam
Metodologi adalah apa yang memberikan tuntutan kekuatan mereka. Kerana setiap model LittleLearner dihantar dengan kawalan tidak ditapis yang dipadankan — seni bina yang sama, kiraan token yang sama, resipi latihan yang sama — pasukan boleh mengaitkan sebarang perbezaan tingkah laku kepada penapis kurikulum sahaja. Pakar matematik selepas terlatih pada penanda aras MathCAMPS membenarkan penyelidik menilai prestasi mengikut gred sekolah, mengesan dengan tepat di mana keupayaan dalam skop berakhir. Dan tidak seperti kebanyakan kertas sempadan, semuanya terbuka: korpus, pangkalan dan pusat pemeriksaan pasca latihan pada ketiga-tiga skala pada HuggingFace, dan demo sembang yang dihoskan, jadi pasukan bebas boleh menyiasat sempadan itu sendiri.
Keterbukaan itu menyemarakkan perdebatan Berita Hacker. Pengulas telah menguji tingkah laku model yang dihoskan pada kelebihan pengetahuannya — sama ada ia menahan diri, meneka atau berhalusinasi apabila ditolak melepasi gred 5 — dan berhujah mengenai implikasi: sesetengahnya membaca keputusan itu sebagai berita buruk untuk gembar-gembur model penaakulan, yang lain menunjukkan bahawa data pralatihan skala web mengandungi jauh lebih banyak daripada konsep sekolah rendah, jadi siling model sempadan adalah lebih tinggi. Penulis kertas itu sendiri berhati-hati dalam perkara ini: dakwaan mereka adalah mengenai perkara yang tidak dapat dilakukan oleh campur tangan standard untuk model dengan pendidikan terkawal yang diketahui, bukan ramalan langsung tentang makmal sempadan.
Mengapa Ia Penting Di Luar Bilik Darjah
Percubaan bercakap secara langsung kepada perdebatan langsung dalam AI. Makmal AI membelanjakan berbilion-bilion untuk rejimen pasca latihan berdasarkan idea bahawa pembelajaran pengukuhan boleh mendorong model asas jauh melebihi kebolehan mentahnya. LittleLearner mencadangkan keuntungan tersebut sebahagian besarnya boleh hidup dalam — dan dibatasi oleh — perkara yang disokong oleh data pralatihan. Itu adalah hujah untuk lebih mengambil berat tentang penyusunan data, dan untuk menangani dakwaan keupayaan pasca latihan "muncul" dengan keraguan.
Keluaran ini juga merupakan instrumen penyelidikan yang tulen, bukan hanya kertas. Pasukan itu mengeluarkan LittleCurriculum dan semua pusat pemeriksaan model secara terbuka, dan halaman projek melakar eksperimen yang didayakan oleh kotak pasir: sama ada RL benar-benar boleh mencipta keupayaan dan bukannya memberi ganjaran, sejauh mana sampel-cekap model mempelajari konsep yang benar-benar baharu seperti nombor negatif apabila ia diperkenalkan, dan sama ada mesin dan kanak-kanak memerlukan pendedahan yang serupa — atau membuat kesilapan yang serupa — semasa mempelajari pecahan.
Untuk bidang yang jarang mendapat kawalan bersih, model dengan pendidikan yang dinyatakan secara eksplisit adalah hadiah yang jarang berlaku. Dan untuk orang lain, ini adalah peringatan yang patut disematkan di atas meja: tiada model — atau orang — boleh membuat alasan untuk keluar daripada perkara yang tidak pernah diajarkan kepada mereka.
Kekal Mendahului AI
Liputan gred semakan rakan sebaya bagi penyelidikan yang membentuk semula AI, dihantar setiap hari. Tandai halaman hab kami untuk perkembangan AI terkini.
Baca lebih banyak berita AI →