Bu hafta Hacker News'te küçük ama çarpıcı bir proje dolaşıyor: donanım tasarımı yapay zeka ajanları tarafından üretilen açık kaynaklı bir yapay zeka hızlandırıcısı olan openTPU. GitHub'da Apache 2.0 lisansı altında yayınlanan depo, yazarlarının "AI tarafından geliştirilen açık kaynaklı bir AI hızlandırıcısı" olarak adlandırdığı şeyi tanımlıyor ve bu türdeki çoğu demodan farklı olarak, meraklıların uçtan uca inceleyebileceği fiziksel bir kart üzerinde gerçek ağırlıklarıyla gerçek üretim modellerini çalıştırıyor.

Proje, kendi README dosyasında iki soru soruyor: Yapay zeka ajanları donanım tasarımında ne kadar ileri gidebilirler ve kendi çıkarımlarını yürüten çipi oluşturabilirler mi? İkinci soru ise kışkırtıcı. Kendi tokenlerini üreten silikonu (veya bu durumda FPGA bit akışını) tasarlayan bir yapay zeka sistemi, endüstrinin hayal gücünün tam olarak nereye gittiğini yakalayan bir döngüdür. For more context on this story, see our ongoing artificial intelligence updates.

Kartta Gerçekte Ne Çalışıyor?

Donanım hedefi, veri merkezi standartlarına göre pek gösterişli değil: iki DDR3 kanalına ve 17,1 GB/s maksimum bellek bant genişliğine sahip Xilinx Kintex-7 xc7k480t FPGA etrafında oluşturulmuş bir Inspur YPCB-00338 kartı. Bu, sonuçları daha az değil, daha ilginç kılan HBM yığınlı hızlandırıcıdan çok uzaktır.

Projenin yayınlanan ölçümlerine göre tasarım, gerçek ağırlıklarıyla on modern açık modeli çalıştırıyor. LFM2.5-230M, int8'de saniyede 59 jetonun ve 4 bitte saniyede 85,8 jetonun kodunu çözer. Qwen3-0.6B saniyede 21,6 token yönetirken, daha büyük modeller beklendiği gibi ölçekleniyor: SmolLM3-3B saniyede 5 token int8, Phi-4-mini (3,8B) 4 ve Qwen3.5-4B 4 bitte saniyede 5,9 token. Gemma 4 E2B ve E4B de katman başına yerleştirme tablolarını kartta yerleşik tutarak çalışır.

Ekip, kartın 4 GiB DRAM'ını aşan uzmanlardan oluşan karma modellerle daha da ileri gitti. LFM2.5-8B-A1B — 1,7 milyarı aktif olmak üzere 8,5 milyar parametre — ana bilgisayar depolama alanından uzmanların akışını sağlayarak saniyede 10,6 jetonun kodunu çözer; uzman kullanımlarının yüzde 98,5'i kart üzerindeki yuvalara ulaşır ve jeton başına yalnızca 5,2 MB aktarılır. Qwen3.5-35B-A3B, PCIe üzerinden jeton başına 153 MB akış sağlarken saniyede 3,95 jetonla çalışır. README, her konfigürasyonun projenin simülatör jetonuyla eşleştiğini belirtir; bu, donanım korsanlarının işin zor kısmı olarak tanıyacağı bir kesinlik iddiasıdır.

Gerçek Bir Silikon Projesi Gibi İnşa Edildi

OpenTPU'yu tipik hobi FPGA demolarından ayıran şey, yığının eksiksiz olmasıdır. Monorepo, SystemVerilog donanım tasarımını, özel bir talimat setini, tam bit simülatörünü, kendi derleyicisine sahip bir çekirdek dilini ve nvidia-smi ruhuna uygun bir otpu-smi izleme yardımcı programı ve bir otpu-chat demosu da dahil olmak üzere PCIe kartını çalıştıran ana bilgisayar yazılımını içerir.

Üretim görüntüsü, dört sütunlu bir sistolik matris ünitesini ve 133,33 MHz'de bir akış motorunu çalıştırıyor; LiteDRAM bellek denetleyicileri bellek çekirdeği içindeki küçük bir CPU tarafından kalibre ediliyor; kart, ana bilgisayar müdahalesi olmadan her iki DDR3 kanalını da 12 saniyede kalibre ediyor. 1 Ekim'den bu yana devreye alınan mevcut yapı, birkaç modelin kodunu önceki görüntüye göre yüzde 8 ila 10 daha hızlı çözerken, DRAM kullanımını zirvenin yüzde 91-94'üne çıkarıyor.

Proje ayrıca, doğruluk için dil modeli kafasını int8'de tutarak, ağırlık başına 4,25 bitlik iki seviyeli blok ölçekleriyle FP4 değerleri üzerine inşa edilmiş 4 bitlik bir ağırlık formatını da belgeliyor. Format, jeton başına bayt sayısını kabaca üçte bir oranında azaltır ve bazı modellerde kod çözme hızını yüzde 40 ila 45 oranında artırır.

README, projenin yaklaşımını, yapay zeka odaklı donanım mimarisi aramasını araştıran daha önceki bir veri havuzu olan otomatik arşiv turnuvasından alınan derslere borçludur. openTPU, bu yöntemin eksiksiz bir hızlandırıcıya uygulanmasıdır; aracıların tasarımı, donanıma dokunmadan önce bir simülatöre göre doğrulanır.

Neden Önemlidir

Buradaki performans Nvidia'yı rahatsız etmeyecek. DDR3'lü Kintex-7, on yıllık bir donanım sınıfıdır ve çalıştırdığı modeller küçüktür. Ancak projenin dolaylı olarak vurguladığı nokta da bu: Hızlandırıcının tamamı (RTL, talimat seti, simülatör, derleyici ve ana bilgisayar yığını) tek bir depoda tek bir kişi tarafından okunabilir ve en azından kısmen bir donanım ekibi yerine yapay zeka aracıları tarafından tasarlandı.

Üç akım bu fikirde birleşiyor. Birincisi, açık kaynaklı yapay zeka donanımı, gereken uzmanlığın genişliği nedeniyle uzun süredir engelleniyor; etmen odaklı tasarım akışı bu engeli azaltır. İkincisi, çıkarım talebi araştırmacıları egzotik özel amaçlı donanımlara doğru itiyor ve otomatik tasarım araştırması bu alanı keşfetmek için doğal bir uyum sağlıyor. Üçüncüsü, kendi kendini barındırma açısı (yapay zekanın üzerinde çalıştığı makineyi oluşturması), projenin Hacker News'teki hızlı yükselişine bakılırsa, topluluğun yakından izlediği bir sinyal haline geldi ve birkaç saat içinde 150'den fazla puan topladı.

Depo 24 Eylül'de oluşturuldu ve en son güncellemesini 2 Ekim'de aldı; ölçülen sonuçlar 1 Ekim'e kadar uzanıyordu; bu, başlı başına izlemeye değer bir gelişme hızıydı. Bir AI hızlandırıcının Python'daki matris çarpımından kablolara kadar nasıl çalıştığını anlamak isteyen herkes için projenin kendi çerçevesi doğrudur: her şey, uçtan uca okuyabileceğiniz küçük bir monorepo'da yaşar.

Aracı tasarımlı donanım ister ciddi bir niş haline gelsin, ister araştırma merakı olarak kalsın, openTPU somut bir şey gösterdi: Yapay zeka modellerinin yazılım yazmasına olanak tanıyan araçlar artık aynı modelleri çalıştıran çalışan, doğrulanmış bir donanım sistemi üretti. Döngü en azından FPGA ölçeğinde kapalıdır.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →