Proyèk open-source wis squeezed model basa 28,9 yuta-parameter menyang mikrokontroler sing biaya watara $8, ngasilaken teks tanggung ing chip ing kira-kira sangang token per detik tanpa sambungan jaringan. Demonstrasi kasebut, sing diterbitake ing GitHub lan kanthi cepet munggah ing kaca ngarep Hacker News, nuduhake sepira wates AI lokal sing cilik wis pindhah ing wektu sing cendhak.

Pusat kerja ing ESP32-S3, chip sing dipasang kanthi murah sing populer karo para penggemar lan produsen hardware. Nganggo model 28.9 yuta parameter ing potongan silikon sing cilik kaya ngono durung suwe, lan proyek kasebut menehi ilustrasi sing jelas babagan dorongan sing luwih akeh menyang AI ing piranti sing dilacak ing saben dina [jangkoan industri AI] (https://aibuzzwire.news). Ing ngendi maya nate dirasakake prentah kanggo model basa sing nyata, sistem sing saya bisa nemokake omah ing pinggir.

Nomer konco mbangun

Proyek kasebut nyedhiyakake spesifikasi kanthi jelas. Model nyimpen 28,9 yuta paramèter, sing udakara 25 yuta manggon ing tabel pencarian lampu kilat. Nganggo chip ESP32-S3 kanthi 512KB SRAM cepet, 8MB PSRAM, lan 16MB panyimpenan lampu kilat. Ing laku tekan udakara 9,5 token per detik nganti pungkasan, utawa 9,7 token per detik saka komputasi murni, lan kabeh model mung 14,9 megabyte nalika disimpen kanthi presisi 4-bit.

Sing paling nggumunake yaiku perbandingan sing ditindakake penulis karo karya sadurunge. Model basa pungkasan sing dikenal nganggo chip ing kelas iki mung 260.000 paramèter. Mbangun anyar ngemu kira-kira satus kaping luwih, lompat sing teka ora saka chip luwih gedhe nanging saka rethinking ngendi data model bener urip.

A trick memori diselang saka Gemma

Masalah inti yaiku mikrokontroler meh ora duwe memori sing cepet. ESP32-S3 nawakake mung 512KB saka SRAM, lan conventionally kabeh model kudu tekan saka kono, kang nyoba sadurungé padha macet ing sawetara atus ewu paramèter.

Workaround dumunung ing pengamatan prasaja. Umume paramèter model basa dumunung ing tabel semat, sing diwaca model tinimbang ngitung. Dadi tinimbang meksa tabel 25-yuta-larik sing gedhe banget kasebut dadi memori cepet sing langka, proyek kasebut ninggalaken ing panyimpenan lampu kilat alon lan mung narik sawetara larik saben token sing bener-bener dibutuhake, kira-kira 450 bait sekaligus. Bagean cilik saka model sing nindakake komputasi nyata tetep ing memori cepet, nalika akeh bobot mung ngenteni ing lampu kilat, sampel sethitik ing wektu.

Teknik kasebut dikenal minangka Per-Layer Embeddings, lan asale saka model Gemma Google, khususe Gemma 3n lan Gemma 4, sing dirancang kanggo telpon lan GPU. Miturut penulis proyek, ora ana sing nate nyoba pendekatan ing chip cilik iki.

Apa sing bisa ditindakake, lan apa sing ora bisa ditindakake

Model kasebut dilatih ing TinyStories, kumpulan data crita bocah-bocah sing prasaja, saengga kemampuane sengaja sempit. Iku nulis crita cekak, biasane koheren, nanging ora bakal njawab pitakonan faktual, tindakake instruksi rumit, nulis kode, utawa alesan bab donya. Penulis jujur ​​sing watesan iki Asal-Usul saka bagean alesan cilik model, lan trik memori ora ngganti.

Sing ndadekake proyek kasebut menarik ora mung kualitas output nanging arsitektur. Prestasi kasebut cocog karo model sing gedhe banget menyang chip sing cilik iki, mbuktekake manawa teknik sing padha nguwasani model sing efisien ing telpon lan server bisa di-push nganti hardware sing regane luwih murah tinimbang sandwich.

Napa AI ing piranti penting

Implikasi kasebut ngluwihi demo teknis sing rapi. Amarga model mlaku kabeh ing chip, ora ana sing dikirim menyang server. Tegese privasi total kanthi konstruksi, ora ana data sing ninggalake piranti kasebut, lan ora ana tagihan awan sing kudu dibayar. Kanggo aplikasi ing wilayah sing adoh, piranti sing kurang daya, utawa setelan sing konektivitas ora bisa dipercaya, kombinasi kasebut pancen migunani.

Iki uga nuduhake masa depan sing model cilik lan khusus disebar ing pirang-pirang milyar piranti sing dipasang kanthi murah tinimbang konsentrasi ing sawetara pusat data raksasa. Tekanan sing padha nyebabake minat ing AI lokal ing laptop lan telpon, yaiku latensi sing luwih murah, biaya sing luwih murah, lan privasi sing luwih kuat, ditrapake kanthi luwih kuat ing skala mikrokontroler.

Undhangan mbukak kanggo tinker

Proyèk iki dirilis ing lisensi MIT permisif, lan penulis wis nuduhake kode lengkap ing GitHub bebarengan karo dokumentasi rinci lan asil pathokan. Keterbukaan kasebut tegese pangembang hardware liyane bisa nyinaoni pendekatan kasebut, adaptasi karo chip liyane, utawa nambah jumlah parameter sing luwih dhuwur.

Dirilis ing slvDev nangani, karya resonated banget karo masyarakat pangembang, ngumpulake atusan upvotes ing Hacker News lan ngajak diskusi bab ngendi technique bisa lelungan sabanjuré. Yen tren kasebut terus, garis ing antarane "model basa" lan piranti lunak sing dipasang biasa bakal saya surem.

Tetep Ahead saka AI

Saka chip $ 8 nganti pusat data milyar dolar, pitakonan babagan ngendi AI mlaku dadi penting kaya sing bisa ditindakake AI. Lapisan hardware berkembang luwih cepet tinimbang sing dingerteni umume, lan proyek sing katon penasaran saiki asring nemtokake arus utama sesuk. Waca warta AI liyane ing AI Buzz Wire kanggo ngetutake saben terobosan ing komputasi pinggiran, efisiensi model, lan intelijen ing piranti.

Terus karo revolusi hardware AI — bukak AI Buzz Wire