Projek sumber terbuka baharu sedang menarik perhatian untuk menangani salah satu batasan degil pembelajaran mesin: membina model bahasa yang tidak pernah berhenti belajar. Dipanggil mini-AGI, projek itu menggambarkan dirinya sebagai pembelajaran berterusan, model bahasa peringkat byte yang memasang seni binanya sendiri, melatih dari awal pada satu GPU dengan 8GB VRAM dan terus belajar daripada semua yang dibacanya.

Projek itu muncul di Berita Hacker pada hujung minggu, di mana ia meningkat kepada lebih seratus mata, dan repositorinya di GitHub dikeluarkan di bawah lesen MIT. Menurut README projek, matlamatnya adalah untuk menunjukkan bahawa pembelajaran berterusan daripada satu aliran data — tanpa melupakan bencana — adalah mungkin walaupun pada perkakasan gred pengguna yang sederhana. For more context on this story, see our ongoing breaking AI news.

Berat pada cakera, bukan dalam VRAM

Helah utama di sebalik mini-AGI ialah skim pengurusan memori yang tidak konvensional. Daripada menyimpan semua parameter model dalam memori GPU, sistem menyimpan pemberatnya sebagai fail biasa pada cakera dan melayari halamannya pada kad grafik apabila ia diperlukan.

Pilihan reka bentuk itu mempunyai akibat yang ketara: kiraan parameter model dibatasi oleh ruang cakera kosong dan bukannya oleh VRAM. README menyatakan bahawa model itu boleh mengembangkan kapasiti baharu semasa berlatih apabila ia berjalan singkat, dan mengurangkan kapasiti yang tidak diminta. Latihan dan inferens dijalankan melalui laluan kod yang sama, jadi tiada rejim penalaan halus yang berasingan dan tiada model asas beku — membaca dan dilatih, dalam perkataan projek, adalah peristiwa yang sama.

Sistem ini disasarkan pada PC atau komputer riba dengan sekurang-kurangnya 8GB VRAM GPU, perkakasan yang sudah dimiliki oleh ramai pembangun.

Mengapa pembelajaran berterusan adalah sukar

Kebanyakan model bahasa yang tersedia hari ini mengikut kitaran hayat yang sama: makmal melatih model, membekukannya dan menghantarnya. Pengguna boleh menala halus di sekeliling tepi, tetapi berat asas tidak pernah berubah lagi. Bahagian motivasi projek berpendapat bahawa ini menjadikan setiap model milik peribadi "model orang lain dengan lapisan nipis anda di atas" — model yang berhenti belajar pada hari ia dihantar.

Halangan itu adalah yang terkenal dalam penyelidikan pembelajaran mesin: pelupaan bencana, kecenderungan rangkaian saraf untuk menimpa pengetahuan yang dipelajari sebelum ini apabila dilatih pada data baharu. Model yang belajar secara berterusan daripada aliran maklumat harian biasanya merendahkan semua yang diketahuinya sebelum ini.

README menggariskan kekangan yang membentuk reka bentuk. Model ini perlu dimuatkan pada 8GB VRAM — bukan dengan pengkuantitian, kerana latihan memerlukan kecerunan dan keadaan pengoptimum yang menambah kira-kira tiga kali ganda memori pemberat itu sendiri. Dan ia tidak boleh lupa, berpegang pada apa yang telah dipelajari sambil menyerap bahan baharu daripada aliran teks yang tidak berkesudahan.

Model peringkat bait yang membina dirinya sendiri

mini-AGI beroperasi pada tahap bait dan bukannya pada token, membaca aliran aksara satu bahagian pada satu masa dan mengambil langkah kecerunan pada setiap bahagian. Projek itu juga mengatakan model itu "memasang seni binanya sendiri," membezakannya daripada model konvensional yang strukturnya ditetapkan oleh penciptanya sebelum latihan bermula.

Pendekatan itu sengaja eksperimen. Ia adalah demonstrasi skala kecil rejim latihan, bukan cabaran kepada sistem sempadan.

Kaveat penting

Pengarang projek adalah eksplisit tentang keadaan semasa sistem. Dalam kata-kata README sendiri, mini-AGI ialah "model peringkat mainan kecil," dan pembaca tidak seharusnya mengharapkan keupayaan peringkat sempadan. Tujuan latihan adalah untuk menunjukkan bahawa pembelajaran berterusan daripada satu aliran data tanpa melupakan bencana adalah mungkin sama sekali — dan mungkin pada perkakasan yang boleh diakses oleh hampir semua orang.

Berat model belum diterbitkan lagi. Larian latihan masih melengkapkan hantaran pertamanya ke atas korpus yang dipelajarinya, dan penulis berkata pemberat akan dilepaskan sebaik pas itu selesai, yang pada kadar semasa tinggal beberapa minggu lagi. Sehingga itu, pemerhati boleh memeriksa sampel daripada sejarah larian latihan pada halaman projek untuk melihat bagaimana model itu telah bertambah baik sepanjang tempoh pembacaan.

Mengapa ia penting

Jika pendekatan itu bertahan apabila model berskala kepada saiz yang lebih berkebolehan, ia menunjukkan kepada jenis pemilikan AI yang berbeza: model peribadi yang hidup pada mesin anda sendiri, terus belajar daripada dokumen dan data yang anda suapkan kepada mereka dan tidak pernah dibekukan pemberatnya mengikut jadual keluaran vendor.

Projek ini juga merupakan peringatan bahawa tidak semua kerja menarik dalam AI berlaku di sempadan. Dengan GPU pengguna tunggal, ruang cakera biasa dan lesen MIT, mini-AGI cuba menjawab soalan yang sebahagian besarnya telah diketepikan oleh makmal besar — ​​sama ada model boleh dibina untuk mempelajari cara orang ramai melakukannya: secara berterusan, daripada apa sahaja yang ditemuinya seterusnya.

Kod dan dokumentasi tersedia di GitHub untuk sesiapa sahaja yang mempunyai perkakasan yang serasi yang ingin mengikutinya, meneruskan projek atau meneruskan latihan model mengikut keperluan mereka.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →