Yeni bir açık kaynaklı proje, makine öğreniminin inatçı sınırlamalarından birinin üstesinden gelme konusunda dikkat çekiyor: öğrenmeyi asla durdurmayan bir dil modeli oluşturmak. Mini-AGI olarak adlandırılan proje kendisini, kendi mimarisini bir araya getiren, 8 GB VRAM'li tek bir GPU üzerinde sıfırdan eğitim veren ve okuduğu her şeyden öğrenmeye devam eden, sürekli öğrenen, bayt düzeyinde bir dil modeli olarak tanımlıyor.

Proje hafta sonu Hacker News'te yer aldı ve yüzün üzerinde puana yükseldi ve GitHub'daki deposu MIT lisansı altında yayınlandı. Projenin README'sine göre amaç, mütevazi, tüketici sınıfı donanımlarda bile tek bir veri akışından (yıkıcı bir unutma olmadan) sürekli öğrenmenin mümkün olduğunu göstermektir. For more context on this story, see our ongoing AI trends.

Ağırlıklar VRAM'de değil, diskte

Mini-AGI'nin arkasındaki temel hile, alışılmadık bir bellek yönetimi şemasıdır. Sistem, tüm model parametrelerini GPU belleğinde tutmak yerine, ağırlıklarını sıradan dosyalar olarak diskte saklar ve gerektiğinde bunları grafik kartına sayfalar.

Bu tasarım seçiminin önemli bir sonucu var: modelin parametre sayısı VRAM yerine boş disk alanıyla sınırlanıyor. README, modelin eğitim sırasında yetersiz kaldığında yeni kapasite artırabileceğini ve hiçbir şeyin talep etmediği kapasiteyi budadığını belirtir. Eğitim ve çıkarım tamamen aynı kod yolundan geçiyor, dolayısıyla ayrı bir ince ayar rejimi ve donmuş temel model yok; okuma ve eğitilmek, projenin ifadesiyle aynı olaydır.

Sistem, çoğu geliştiricinin zaten sahip olduğu donanım olan en az 8 GB VRAM GPU'ya sahip bir PC veya dizüstü bilgisayarı hedef alıyor.

Sürekli öğrenme neden zordur?

Günümüzde mevcut olan dil modellerinin çoğu aynı yaşam döngüsünü takip etmektedir: Laboratuvar, modeli eğitir, dondurur ve gönderir. Kullanıcılar kenarlarda ince ayar yapabilir ancak taban ağırlıkları bir daha asla değişmez. Projenin motivasyon bölümü, bunun kişisel olarak sahip olunan her modeli "üstünde sizin ince bir katmanınızın bulunduğu başka birinin modeli" haline getirdiğini, yani gönderildiği gün öğrenmeyi bırakan bir model haline geldiğini savunuyor.

Bu engel, makine öğrenimi araştırmalarında iyi bilinen bir engeldir: yıkıcı unutma, sinir ağlarının, yeni veriler üzerinde eğitildiğinde önceden öğrenilen bilgilerin üzerine yazma eğilimi. Günlük bilgi akışından sürekli olarak öğrenen bir model, genellikle daha önce bildiği her şeyin değerini düşürür.

README, tasarımı şekillendiren kısıtlamaların ana hatlarını çizer. Modelin 8 GB VRAM'e sığması gerekiyor; nicelemeyle değil, çünkü eğitim, ağırlıkların hafızasının kabaca üç katı kadar ekleyen degradeler ve optimize edici durum gerektiriyor. Ve bitmek bilmeyen bir metin akışından yeni materyaller alırken, daha önce öğrendiklerine tutunarak unutmaması gerekir.

Kendi kendini oluşturan bayt düzeyinde bir model

mini-AGI, jetonlar yerine bayt seviyesinde çalışır, karakter akışını her seferinde bir parça olarak okur ve her parça üzerinde kademeli bir adım atar. Proje aynı zamanda modelin "kendi mimarisini oluşturduğunu", bu özelliğin onu, yapısı yaratıcıları tarafından eğitim başlamadan önce sabitlenen geleneksel modellerden ayırdığını söylüyor.

Yaklaşım kasıtlı olarak deneyseldir. Bu, sınır sistemlerine bir meydan okuma değil, bir eğitim rejiminin küçük ölçekli bir gösterisidir.

Önemli uyarılar

Projenin yazarı sistemin mevcut durumu hakkında açıkça bilgi veriyor. README'nin kendi deyimiyle mini-AGI "oyuncak düzeyinde küçük bir modeldir" ve okuyucular sınır düzeyinde yetenekler beklememelidir. Alıştırmanın amacı, tek bir veri akışından, yıkıcı bir unutma olmadan sürekli öğrenmenin mümkün olduğunu ve neredeyse herkesin erişebileceği donanımlarda mümkün olduğunu göstermektir.

Modelin ağırlıkları henüz yayınlanmadı. Eğitim çalışması, öğrenildiği derlem üzerindeki ilk geçişini hâlâ tamamlıyor ve yazar, bu geçiş tamamlandıktan sonra ağırlıkların serbest bırakılacağını söylüyor ki bu şu anki oranla birkaç hafta uzakta. O zamana kadar gözlemciler, modelin okuma süreci boyunca nasıl geliştiğini görmek için proje sayfasındaki eğitim çalıştırması geçmişinden örnekleri inceleyebilirler.

Neden önemlidir?

Model daha yetenekli boyutlara ölçeklendikçe yaklaşım geçerliyse, farklı türde bir yapay zeka sahipliğine işaret eder: kendi makinenizde yaşayan, onlara beslediğiniz belgelerden ve verilerden öğrenmeye devam eden ve ağırlıkları hiçbir zaman bir satıcının sürüm planına göre dondurulmayan kişisel modeller.

Proje aynı zamanda yapay zekadaki tüm ilginç çalışmaların sınırda gerçekleşmediğini de hatırlatıyor. Tek bir tüketici GPU'su, sıradan disk alanı ve MIT lisansı ile mini-AGI, büyük laboratuvarların büyük ölçüde gözden kaçırdığı bir soruyu yanıtlamaya çalışıyor: insanların yaptığı gibi sürekli olarak, daha sonra karşılaştığı her şeyden öğrenmek için bir model oluşturulup oluşturulamayacağı.

Kod ve belgeler, uyumlu donanıma sahip olup takip etmek, projeyi çatallamak veya uygun gördükleri şekilde modeli eğitmeye devam etmek isteyen herkes için GitHub'da mevcuttur.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →