Proyèk open-source anyar narik kawigatosan kanggo ngatasi salah sawijining watesan bandel pembelajaran mesin: mbangun model basa sing ora mandheg sinau. Disebut mini-AGI, proyek kasebut nggambarake awake dhewe minangka model basa tingkat bait sing terus-terusan, sing nggawe arsitektur dhewe, nglatih saka awal ing GPU siji kanthi 8GB VRAM, lan terus sinau saka kabeh sing diwaca.
Proyèk kasebut muncul ing Hacker News ing akhir minggu, ing ngendi iku munggah nganti luwih saka satus poin, lan repositori ing GitHub dirilis ing sangisore lisensi MIT. Miturut README proyek kasebut, tujuane kanggo nduduhake manawa sinau terus-terusan saka siji aliran data - tanpa dilalekake bencana - bisa uga sanajan ing hardware kelas konsumen sing andhap asor. For more context on this story, see our ongoing AI trends.
Bobot ing disk, ora ing VRAM
Trik tengah ing mburi mini-AGI yaiku skema manajemen memori sing ora konvensional. Tinimbang nyekeli kabeh parameter model ing memori GPU, sistem nyimpen bobot minangka file biasa ing disk lan kaca ing kertu grafis sing dibutuhake.
Pilihan desain kasebut duwe akibat sing signifikan: jumlah parameter model diwatesi karo ruang disk sing bebas tinimbang VRAM. README nyatakake yen model bisa tuwuh kapasitas anyar nalika latihan nalika mlaku cendhak, lan kapasitas prunes sing boten nyuwun. Latihan lan inferensi mlaku liwat jalur kode sing padha, saengga ora ana rezim fine-tuning sing kapisah lan ora ana model dhasar sing beku - maca lan dilatih, ing tembung proyek, acara sing padha.
Sistem iki diangkah ing PC utawa laptop karo paling 8GB VRAM GPU, hardware sing wis akeh gawe.
Napa sinau terus-terusan angel
Umume model basa sing kasedhiya saiki ngetutake siklus urip sing padha: laboratorium nglatih model, beku, lan dikirim. Pangguna bisa nyetel apik ing pinggir, nanging bobot dhasar ora bakal diganti maneh. Bagean motivasi proyek kasebut nyatakake yen iki ndadekake saben model sing diduweni pribadi "model wong liya kanthi lapisan tipis sampeyan ing ndhuwur" - sing mandheg sinau nalika dikirim.
Rintangan kasebut kondhang ing riset pembelajaran mesin: lali bencana, kecenderungan jaringan saraf kanggo nimpa kawruh sing wis dipelajari nalika dilatih ing data anyar. Model sing sinau terus-terusan saka aliran informasi saben dina biasane ngrusak kabeh sing wis dingerteni sadurunge.
README negesake kendala sing nggawe desain kasebut. Model kasebut kudu pas karo 8GB VRAM - ora nganggo kuantisasi, amarga latihan mbutuhake gradien lan negara pangoptimal sing nambahake memori kira-kira kaping telu saka bobot kasebut. Lan kudu ora lali, nyekel apa sing wis dipelajari nalika nyerep materi anyar saka aliran teks sing ora ana pungkasane.
Model tingkat byte sing mbangun dhewe
mini-AGI makaryakke ing tingkat byte tinimbang ing token, maca stream karakter siji cuwilan ing wektu lan njupuk langkah gradien ing saben cuwilan. Proyèk kasebut uga ujar manawa model kasebut "ngrakit arsitektur dhewe," mbedakake saka model konvensional sing strukture ditemtokake dening pangripta sadurunge latihan diwiwiti.
Pendekatan kasebut sengaja eksperimen. Iki minangka demonstrasi skala cilik saka rezim latihan, dudu tantangan kanggo sistem perbatasan.
Caveats penting
Penulis proyek kasebut kanthi jelas babagan kahanan sistem saiki. Ing tembung README dhewe, mini-AGI minangka "model tingkat dolanan cilik," lan para pamaca ora kudu ngarep-arep kemampuan tingkat wates. Inti saka latihan kasebut yaiku kanggo nuduhake yen sinau terus-terusan saka aliran data siji tanpa dilalekake bencana bisa ditindakake - lan bisa uga ana ing hardware sing meh kabeh bisa diakses.
Bobot model durung diterbitake. Latihan latihan isih ngrampungake pass pertama ing korpus sing dipelajari, lan penulis ujar manawa bobote bakal diluncurake yen pass kasebut rampung, sing saiki wis sawetara minggu. Nganti saiki, para pengamat bisa mriksa conto saka riwayat latihan ing kaca proyek kanggo ndeleng kepiye model kasebut wis apik sajrone maca.
Apa iku penting
Yen pendekatan kasebut terus dadi model kanthi ukuran sing luwih apik, iki nuduhake macem-macem kepemilikan AI: model pribadhi sing manggon ing mesin sampeyan dhewe, terus sinau saka dokumen lan data sing sampeyan feed, lan ora bakal duwe bobote beku miturut jadwal rilis vendor.
Proyek kasebut uga minangka pangeling yen ora kabeh karya menarik ing AI kedadeyan ing wates. Kanthi GPU konsumen siji, ruang disk biasa lan lisensi MIT, mini-AGI nyoba mangsuli pitakon sing umume ditindakake dening laboratorium gedhe - apa model bisa dibangun kanggo sinau cara wong: terus-terusan, saka apa wae sing bakal ditemoni sabanjure.
Kode lan dokumentasi kasedhiya ing GitHub kanggo sapa wae sing duwe hardware sing kompatibel sing pengin ngetutake, nggawe proyek, utawa terus nglatih model sing cocog.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →