Sebuah proyek sumber terbuka baru menarik perhatian untuk mengatasi salah satu keterbatasan pembelajaran mesin: membangun model bahasa yang tidak pernah berhenti belajar. Disebut mini-AGI, proyek ini menggambarkan dirinya sebagai model bahasa tingkat byte pembelajaran berkelanjutan yang merakit arsitekturnya sendiri, berlatih dari awal pada satu GPU dengan VRAM 8 GB, dan terus belajar dari semua yang dibacanya.
Proyek ini muncul di Hacker News pada akhir pekan, dan mencapai lebih dari seratus poin, dan repositorinya di GitHub dirilis di bawah lisensi MIT. Menurut proyek README, tujuannya adalah untuk menunjukkan bahwa pembelajaran terus-menerus dari satu aliran data – tanpa melupakan bencana – dapat dilakukan bahkan pada perangkat keras tingkat konsumen yang sederhana. For more context on this story, see our ongoing AI news.
Bobot di disk, bukan di VRAM
Trik utama di balik mini-AGI adalah skema manajemen memori yang tidak konvensional. Daripada menyimpan semua parameter model dalam memori GPU, sistem menyimpan bobotnya sebagai file biasa di disk dan memasukkannya ke dalam kartu grafis sesuai kebutuhan.
Pilihan desain tersebut memiliki konsekuensi yang signifikan: jumlah parameter model dibatasi oleh ruang disk kosong, bukan oleh VRAM. README menyatakan bahwa model dapat meningkatkan kapasitas baru saat pelatihan ketika jumlahnya terbatas, dan memangkas kapasitas yang tidak dibutuhkan apa pun. Pelatihan dan inferensi dijalankan melalui jalur kode yang persis sama, sehingga tidak ada rezim penyesuaian yang terpisah dan tidak ada model dasar yang dibekukan — membaca dan dilatih, dalam kata-kata proyek, adalah peristiwa yang sama.
Sistem ini ditargetkan pada PC atau laptop dengan setidaknya GPU VRAM 8 GB, perangkat keras yang sudah dimiliki banyak pengembang.
Mengapa belajar terus-menerus itu sulit
Sebagian besar model bahasa yang tersedia saat ini mengikuti siklus hidup yang sama: laboratorium melatih model, membekukannya, dan mengirimkannya. Pengguna dapat menyempurnakan bagian tepinya, namun bobot dasarnya tidak pernah berubah lagi. Bagian motivasi proyek berpendapat bahwa hal ini membuat setiap model milik pribadi menjadi "model orang lain dengan lapisan tipis diri Anda di atasnya" - model yang berhenti belajar pada hari peluncurannya.
Kendala yang sering ditemui dalam penelitian pembelajaran mesin adalah: bencana lupa, yaitu kecenderungan jaringan saraf untuk menimpa pengetahuan yang telah dipelajari sebelumnya ketika dilatih dengan data baru. Model yang terus-menerus belajar dari aliran informasi harian biasanya menurunkan segala sesuatu yang telah diketahuinya sebelumnya.
README menguraikan batasan yang membentuk desain. Model harus sesuai dengan VRAM 8 GB — bukan dengan kuantisasi, karena pelatihan memerlukan gradien dan status pengoptimal yang menambah sekitar tiga kali memori bobot itu sendiri. Dan mereka tidak boleh lupa, berpegang pada apa yang telah mereka pelajari sambil menyerap materi baru dari aliran teks yang tak ada habisnya.
Model tingkat byte yang dibangun sendiri
mini-AGI beroperasi pada tingkat byte, bukan pada token, membaca aliran karakter satu bagian pada satu waktu dan mengambil langkah gradien pada setiap bagian. Proyek ini juga mengatakan bahwa model tersebut “merakit arsitekturnya sendiri”, yang membedakannya dari model konvensional yang strukturnya ditetapkan oleh pembuatnya sebelum pelatihan dimulai.
Pendekatan ini sengaja bersifat eksperimental. Ini adalah demonstrasi skala kecil dari rezim pelatihan, bukan tantangan terhadap sistem perbatasan.
Peringatan penting
Penulis proyek secara eksplisit menjelaskan keadaan sistem saat ini. Dalam kata-kata README sendiri, mini-AGI adalah "model mainan kecil", dan pembaca tidak boleh mengharapkan kemampuan tingkat depan. Inti dari latihan ini adalah untuk menunjukkan bahwa pembelajaran terus-menerus dari satu aliran data tanpa adanya bencana lupa bisa dilakukan — dan mungkin dilakukan pada perangkat keras yang dapat diakses oleh hampir semua orang.
Bobot model belum dipublikasikan. Latihan yang dijalankan masih menyelesaikan lintasan pertama pada korpus yang dipelajarinya, dan penulis mengatakan bobot akan dilepaskan setelah lintasan tersebut selesai, yang pada tingkat saat ini tinggal beberapa minggu lagi. Hingga saat itu, pengamat dapat memeriksa sampel dari riwayat pelaksanaan pelatihan di halaman proyek untuk melihat peningkatan model selama proses pembacaan.
Mengapa itu penting
Jika pendekatan ini bertahan ketika model ditingkatkan ke ukuran yang lebih mumpuni, hal ini mengarah pada jenis kepemilikan AI yang berbeda: model pribadi yang hidup di mesin Anda sendiri, terus belajar dari dokumen dan data yang Anda berikan, dan bobotnya tidak pernah dibekukan oleh jadwal rilis vendor.
Proyek ini juga merupakan pengingat bahwa tidak semua pekerjaan menarik di bidang AI terjadi di garis depan. Dengan GPU konsumen tunggal, ruang disk biasa, dan lisensi MIT, mini-AGI mencoba menjawab pertanyaan yang sebagian besar diabaikan oleh laboratorium besar — apakah suatu model dapat dibuat untuk mempelajari cara manusia melakukannya: secara terus-menerus, dari apa pun yang ditemuinya selanjutnya.
Kode dan dokumentasi tersedia di GitHub untuk siapa saja yang memiliki perangkat keras yang kompatibel dan ingin mengikuti, melakukan proyek, atau melanjutkan pelatihan model sesuai keinginan mereka.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →