Açık kaynaklı bir proje, 28,9 milyon parametreli bir dil modelini, maliyeti yaklaşık 8 dolar olan bir mikro denetleyiciye sıkıştırdı ve hiçbir ağ bağlantısı olmadan, saniyede yaklaşık dokuz jetonla tamamen çip üzerinde metin üretti. GitHub'da yayınlanan ve Hacker News ön sayfasında hızla tırmanan gösteri, küçük, yerel yapay zekanın sınırlarının kısa sürede ne kadar ilerlediğini gösteriyor.

Çalışma, hobiciler ve donanım üreticileri arasında popüler olan, ucuz ve yerleşik bir çip olan ESP32-S3 üzerinde yoğunlaşıyor. 28,9 milyon parametreli bir modeli bu kadar küçük bir silikon parçası üzerinde çalıştırmak yakın zamana kadar mantıksız görünüyordu ve proje, günlük Yapay Zeka endüstrisi haberimizde takip ettiğimiz cihaz içi yapay zekaya yönelik daha geniş ilerlemenin canlı bir örneğini sunuyor. Bulutun bir zamanlar herhangi bir gerçek dil modeli için zorunlu olduğu düşünülürken, giderek daha yetenekli sistemler uçta kendine yer buluyor.

Yapının arkasındaki sayılar

Proje, özelliklerini açıkça ortaya koyuyor. Model, yaklaşık 25 milyonu flash arama tablosunda bulunan 28,9 milyon parametreyi saklıyor. 512KB hızlı SRAM, 8MB PSRAM ve 16MB flash depolamaya sahip bir ESP32-S3 çipinde çalışır. Pratikte uçtan uca saniyede yaklaşık 9,5 jetona veya saf hesaplamada saniyede 9,7 jetona ulaşır ve modelin tamamı 4 bit hassasiyette depolandığında yalnızca 14,9 megabayt yer kaplar.

En çarpıcı olanı, yazarın önceki çalışmalarıyla yaptığı karşılaştırmadır. Bu sınıftaki bir çip üzerinde çalıştığı bilinen son dil modeli yalnızca 260.000 parametreyi barındırıyordu. Yeni yapı kabaca yüz kat daha fazlasını barındırıyor; bu daha büyük bir çipten değil, modelin verilerinin gerçekte nerede yaşadığının yeniden düşünülmesinden kaynaklanan bir sıçrama.

Gemma'dan alınan bir hafıza numarası

Temel sorun, bir mikro denetleyicinin neredeyse hiç hızlı belleğe sahip olmamasıdır. ESP32-S3 yalnızca 512KB SRAM sunuyor ve geleneksel olarak modelin tamamına buradan erişilebilmesi gerekiyor, bu nedenle önceki denemeler birkaç yüz bin parametreye takılı kalmıştı.

Çözüm basit bir gözleme dayanır. Bir dil modelinin parametrelerinin çoğu, modelin hesaplamak yerine okuduğu bir yerleştirme tablosunda bulunur. Dolayısıyla, 25 milyon satırlık devasa tabloyu kıt hızlı belleğe zorlamak yerine, proje onu yavaş flash depolamada bırakıyor ve yalnızca her bir tokenın gerçekten ihtiyaç duyduğu bir avuç satırı, yani bir seferde yaklaşık 450 baytı çekiyor. Modelin gerçek hesaplamayı gerçekleştiren küçük kısmı hızlı bellekte kalırken, ağırlıkların büyük kısmı her seferinde biraz örneklenerek flaşta bekler.

Bu teknik, Katman Başına Yerleştirme olarak bilinir ve Google'ın Gemma modellerinden, özellikle de telefonlar ve GPU'lar için tasarlandığı Gemma 3n ve Gemma 4'ten kaynaklanmıştır. Projenin yazarına göre daha önce hiç kimse bu kadar küçük bir çip üzerinde bu yaklaşımı denememişti.

Ne yapabilir, ne yapamaz

Model, basit çocuk hikayelerinden oluşan bir veri kümesi olan TinyStories üzerinde eğitildi, dolayısıyla yetenekleri kasıtlı olarak daraltıldı. Kısa, çoğunlukla tutarlı hikayeler yazar, ancak gerçek sorulara yanıt vermez, karmaşık talimatları izlemez, kod yazmaz veya dünya hakkında mantık yürütmez. Yazar, bu sınırlamanın modelin küçük akıl yürütme kısmından kaynaklandığını ve hafıza hilesinin bunu değiştirmediğini açıkça belirtiyor.

Dolayısıyla projeyi ilginç kılan çıktı kalitesi değil mimarisidir. Başarı, bu kadar büyük bir modeli bu kadar küçük bir çipe sığdırmak ve telefonlarda ve sunucularda verimli modelleri destekleyen aynı tekniklerin, bir sandviçten daha düşük maliyetli donanıma kadar uygulanabileceğini kanıtlamak.

Cihazdaki yapay zeka neden önemlidir?

Etkileri düzgün bir teknik demonun çok ötesine uzanıyor. Model tamamen çip üzerinde çalıştığı için sunucuya hiçbir şey gönderilmez. Bu, yapı gereği tam gizlilik anlamına gelir, cihazdan hiçbir veri çıkmaz ve ödenecek bulut faturası yoktur. Uzak bölgelerdeki uygulamalar, düşük güçlü cihazlar veya bağlantının güvenilmez olduğu ayarlar için bu kombinasyon gerçekten kullanışlıdır.

Aynı zamanda küçük, özel modellerin bir avuç dev veri merkezinde yoğunlaşmak yerine milyarlarca ucuz gömülü cihaza dağıtıldığı bir geleceğe de işaret ediyor. Dizüstü bilgisayarlar ve telefonlarda yerel yapay zekaya olan ilgiyi artıran aynı baskılar, yani daha düşük gecikme süresi, daha düşük maliyet ve daha güçlü gizlilik, mikro denetleyici ölçeğinde daha da güçlü bir şekilde geçerlidir.

Tamir etmeye açık bir davet

Proje, izin verilen MIT lisansı altında yayınlandı ve yazar, ayrıntılı belgeler ve kıyaslama sonuçlarıyla birlikte kodun tamamını GitHub'da paylaştı. Bu açıklık, diğer donanım geliştiricilerinin yaklaşımı inceleyebileceği, onu diğer çiplere uyarlayabileceği veya parametre sayısını daha da yükseğe çıkarabileceği anlamına geliyor.

slvDev adı altında yayınlanan çalışma, geliştirici topluluğu arasında güçlü bir yankı uyandırdı, Hacker News'te yüzlerce olumlu oy topladı ve tekniğin bundan sonra nereye varabileceği konusunda tartışmaları teşvik etti. Eğilim devam ederse, bir "dil modeli" ile sıradan bir gömülü yazılım parçası arasındaki çizgi çok daha bulanıklaşmak üzeredir.

Yapay Zekanın Önünde Olun

8 dolarlık çiplerden milyar dolarlık veri merkezlerine kadar, yapay zekanın nerede çalıştığı sorusu, yapay zekanın yapabilecekleri kadar önemli hale geliyor. Donanım katmanı çoğu insanın fark ettiğinden daha hızlı gelişiyor ve bugün merak uyandıran projeler çoğunlukla yarının ana akımını tanımlıyor. Uç bilişim, model verimliliği ve cihaz içi zeka alanındaki her atılımı takip etmek için AI Buzz Wire'da daha fazla AI haberini okuyun.

Yapay zeka donanım devrimini takip edin — AI Buzz Wire'ı ziyaret edin