Projek sumber terbuka telah memerah model bahasa 28.9 juta parameter pada mikropengawal yang berharga kira-kira $8, menjana teks sepenuhnya pada cip pada kira-kira sembilan token sesaat tanpa sambungan rangkaian sama sekali. Demonstrasi yang diterbitkan di GitHub dan pantas mendaki muka depan Berita Hacker, menunjukkan sejauh mana sempadan AI tempatan yang kecil telah bergerak dalam masa yang singkat.
Kerja ini berpusat pada ESP32-S3, cip terbenam murah yang popular dengan penggemar dan pembuat perkakasan. Menjalankan model 28.9 juta parameter pada sekeping silikon sekecil itu nampaknya tidak masuk akal tidak lama dahulu, dan projek itu menawarkan ilustrasi yang jelas tentang dorongan yang lebih luas ke arah AI pada peranti yang kami jejaki dalam [liputan industri AI] harian kami (https://aibuzzwire.news). Di mana awan pernah dirasakan wajib untuk mana-mana model bahasa sebenar, sistem yang semakin berkebolehan mencari rumah di pinggir.
Nombor di sebalik binaan
Projek itu memaparkan spesifikasinya dengan jelas. Model ini menyimpan 28.9 juta parameter, yang mana kira-kira 25 juta hidup dalam jadual carian kilat. Ia berjalan pada cip ESP32-S3 dengan 512KB SRAM pantas, 8MB PSRAM dan 16MB storan kilat. Dalam amalan, ia mencapai kira-kira 9.5 token sesaat hujung ke hujung, atau 9.7 token sesaat pengiraan tulen, dan keseluruhan model menduduki hanya 14.9 megabait apabila disimpan pada ketepatan 4-bit.
Paling menarik ialah perbandingan yang dibuat oleh penulis dengan karya terdahulu. Model bahasa terakhir yang diketahui berjalan pada cip dalam kelas ini hanya memegang 260,000 parameter. Binaan baharu ini memegang kira-kira seratus kali ganda lebih banyak, lonjakan yang datang bukan daripada cip yang lebih besar tetapi daripada memikirkan semula di mana data model sebenarnya berada.
Helah ingatan yang dipinjam daripada Gemma
Masalah utama ialah mikropengawal mempunyai hampir tiada memori yang cepat. ESP32-S3 menawarkan hanya 512KB SRAM, dan secara konvensional keseluruhan model perlu dicapai dari sana, itulah sebabnya percubaan sebelumnya tersekat pada beberapa ratus ribu parameter.
Penyelesaiannya bergantung pada pemerhatian mudah. Kebanyakan parameter model bahasa terletak dalam jadual pembenaman, yang model itu membaca dan bukannya mengira. Oleh itu, daripada memaksa jadual 25 juta baris yang sangat besar itu ke dalam memori pantas yang terhad, projek itu meninggalkannya dalam storan denyar perlahan dan menarik hanya segelintir baris yang sebenarnya diperlukan oleh setiap token, kira-kira 450 bait pada satu masa. Bahagian kecil model yang melakukan pengiraan sebenar kekal dalam ingatan pantas, manakala sebahagian besar pemberat hanya menunggu dalam kilat, diambil sampel sedikit demi sedikit.
Teknik itu dikenali sebagai Per-Layer Embeddings, dan ia berasal daripada model Gemma Google, khususnya Gemma 3n dan Gemma 4, di mana ia direka untuk telefon dan GPU. Menurut pengarang projek itu, tiada siapa sebelum ini mencuba pendekatan pada cip sekecil ini.
Apa yang boleh dilakukan, dan apa yang tidak boleh
Model ini dilatih pada TinyStories, set data cerita kanak-kanak yang mudah, jadi kebolehannya sengaja sempit. Ia menulis cerita pendek, kebanyakannya koheren, tetapi ia tidak akan menjawab soalan fakta, mengikut arahan yang rumit, menulis kod atau alasan tentang dunia. Penulis berterus terang bahawa had ini berpunca daripada bahagian penaakulan kecil model, dan helah ingatan tidak mengubahnya.
Oleh itu, apa yang menjadikan projek itu menarik bukan kualiti keluarannya tetapi seni binanya. Pencapaian ini sesuai dengan model sebesar ini pada cip sekecil ini, membuktikan bahawa teknik yang sama menjanakan model yang cekap pada telefon dan pelayan boleh ditolak sehingga ke perkakasan yang harganya lebih murah daripada sandwic.
Mengapa AI pada peranti penting
Implikasinya menjangkau jauh melebihi demo teknikal yang kemas. Oleh kerana model berjalan sepenuhnya pada cip, tiada apa yang pernah dihantar ke pelayan. Ini bermakna privasi sepenuhnya mengikut pembinaan, tiada data meninggalkan peranti dan tiada bil awan yang perlu dibayar. Untuk aplikasi di kawasan terpencil, peranti berkuasa rendah atau tetapan yang sambungannya tidak boleh dipercayai, gabungan itu benar-benar berguna.
Ia juga menunjukkan masa depan di mana model kecil dan khusus diedarkan merentasi berbilion-bilion peranti terbenam murah dan bukannya tertumpu di segelintir pusat data gergasi. Tekanan yang sama mendorong minat terhadap AI tempatan pada komputer riba dan telefon, iaitu kependaman yang lebih rendah, kos yang lebih rendah dan privasi yang lebih kukuh, digunakan dengan lebih kuat pada skala mikropengawal.
Jemputan terbuka untuk bermain-main
Projek ini dikeluarkan di bawah lesen MIT permisif, dan pengarang telah berkongsi kod penuh di GitHub bersama-sama dengan dokumentasi terperinci dan hasil penanda aras. Keterbukaan itu bermakna pembangun perkakasan lain boleh mengkaji pendekatan, menyesuaikannya dengan cip lain, atau menolak kiraan parameter dengan lebih tinggi lagi.
Dikeluarkan di bawah kendalian slvDev, kerja itu bergema kuat dengan komuniti pembangun, mengumpulkan beratus-ratus undian naik pada Berita Hacker dan mendorong perbincangan tentang ke mana teknik itu mungkin pergi seterusnya. Jika trend itu berlaku, garis antara "model bahasa" dan perisian terbenam biasa akan menjadi lebih kabur.
Kekal Mendahului AI
Daripada cip $8 kepada pusat data berbilion dolar, persoalan di mana AI berjalan menjadi sama pentingnya dengan apa yang boleh dilakukan oleh AI. Lapisan perkakasan berkembang lebih pantas daripada kebanyakan orang sedar, dan projek yang kelihatan seperti rasa ingin tahu hari ini sering mentakrifkan arus perdana esok. Baca lebih banyak berita AI di AI Buzz Wire untuk mengikuti setiap kejayaan dalam pengkomputeran tepi, kecekapan model dan kecerdasan pada peranti.
Ketahui revolusi perkakasan AI — lawati AI Buzz Wire


