Un proiect mic, dar izbitor, circulă pe Hacker News săptămâna aceasta: openTPU, un accelerator AI open-source al cărui design hardware a fost el însuși produs de agenți AI. Depozitul, publicat sub licența Apache 2.0 pe GitHub, descrie ceea ce autorii săi numesc „un accelerator AI open-source, dezvoltat de AI” – și, spre deosebire de majoritatea demonstrațiilor din acest gen, rulează modele de producție reale cu greutățile lor reale pe un card fizic pe care entuziaștii îl pot studia cap la cap.
Proiectul pune două întrebări, în cuvintele propriului README: cât de departe pot merge agenții AI la designul hardware și pot construi cipul care își execută propria inferență? A doua întrebare este cea provocatoare. Un sistem AI care proiectează siliciul – sau, în acest caz, fluxul de biți FPGA – care își generează propriile jetoane este o buclă care surprinde exact încotro se îndreaptă imaginația industriei. For more context on this story, see our ongoing more AI stories.
Ce rulează de fapt pe card
Ținta hardware este lipsită de farmec după standardele centrelor de date: un card Inspur YPCB-00338 construit în jurul unui FPGA Xilinx Kintex-7 xc7k480t cu două canale DDR3 și o lățime de bandă de memorie de 17,1 GB/s. Este departe de un accelerator stivuit cu HBM, ceea ce face rezultatele mai interesante, nu mai puțin.
Conform măsurătorilor publicate ale proiectului, designul rulează zece modele deschise moderne cu greutățile lor reale. LFM2.5-230M decodifică la 59 de jetoane pe secundă în int8 și 85,8 jetoane pe secundă pe 4 biți. Qwen3-0.6B gestionează 21,6 jetoane pe secundă, în timp ce modelele mai mari se reduc conform așteptărilor: SmolLM3-3B la 5 jetoane pe secundă int8, Phi-4-mini (3,8B) la 4 și Qwen3.5-4B la 5,9 jetoane pe secundă pe 4 biți. Gemma 4 E2B și E4B rulează, de asemenea, păstrând tabelele de încorporare pe strat rezidente pe card.
Echipa a mers mai departe cu modele mixte de experți care depășesc cei 4 GiB de DRAM ai cardului. LFM2.5-8B-A1B — 8,5 miliarde de parametri cu 1,7 miliarde activi — decodifică la 10,6 jetoane pe secundă de către experții în streaming din stocarea gazdei, cu 98,5% din utilizările experților accesând sloturile de pe card și doar 5,2 MB transferați per token. Qwen3.5-35B-A3B rulează la 3,95 jetoane pe secundă în timp ce transmite 153 MB pe token pe PCIe. Fiecare configurație, afirmă README, se potrivește cu simbolul simulatorului proiectului pentru token - o afirmație de exactitate pe care hackerii hardware o vor recunoaște ca fiind partea grea a sarcinii.
Construit ca un proiect real de silicon
Ceea ce separă openTPU de demonstrațiile tipice FPGA de hobby este caracterul complet al stivei. Monorepo conține designul hardware SystemVerilog, un set de instrucțiuni personalizate, un simulator de biți exact, un limbaj kernel cu propriul compilator și software-ul gazdă care conduce placa PCIe, inclusiv un utilitar de monitorizare otpu-smi în spiritul nvidia-smi și un demo otpu-chat.
Imaginea de producție rulează o unitate de matrice sistolică cu patru coloane și un motor de flux la 133,33 MHz, cu controlere de memorie LiteDRAM calibrate de un procesor mic în interiorul nucleului de memorie - cardul calibrează ambele canale DDR3 în 12 secunde fără implicarea gazdei. Build-ul actual, implementat de la 1 octombrie, decodifică mai multe modele cu 8 până la 10% mai rapid decât imaginea anterioară, în timp ce împinge utilizarea DRAM la 91-94% din vârf.
Proiectul documentează, de asemenea, un format de greutate de 4 biți construit pe valori FP4 cu scale de bloc pe două niveluri la 4,25 biți pe greutate, păstrând capul modelului de limbaj în int8 pentru acuratețe. Formatul reduce octeții pe token cu aproximativ o treime și crește viteza de decodare cu 40 până la 45% la unele modele.
README creditează abordarea proiectului față de lecțiile dintr-un depozit anterior, auto-arch-tournament, care a explorat căutarea arhitecturii hardware bazată pe inteligență artificială. openTPU este aplicarea acelei metode la un accelerator complet, cu designul agenților validat față de un simulator înainte de a atinge vreodată hardware-ul.
De ce contează
Performanța de aici nu va deranja Nvidia. Un Kintex-7 cu DDR3 este o clasă de hardware veche de un deceniu, iar modelele pe care le rulează sunt mici. Dar acesta este punctul de vedere implicit al proiectului: întregul accelerator - RTL, set de instrucțiuni, simulator, compilator și stiva gazdă - este lizibil pentru o singură persoană, într-un singur depozit și a fost proiectat cel puțin parțial de agenți AI, mai degrabă decât de o echipă hardware.
Trei curente converg în această idee. În primul rând, hardware-ul AI cu sursă deschisă a fost de mult împiedicat de amploarea experienței necesare; un flux de proiectare condus de agent coboară această barieră. În al doilea rând, cererea de inferență îi împinge pe cercetători către hardware exotic cu scop special, iar căutarea automată a designului este o potrivire naturală pentru explorarea spațiului respectiv. În al treilea rând, unghiul de auto-găzduire - AI construind mașina pe care rulează - a devenit un semnal pe care comunitatea îl urmărește îndeaproape, judecând după creșterea rapidă a proiectului pe Hacker News, unde a adunat peste 150 de puncte în câteva ore.
Depozitul a fost creat pe 24 septembrie și a primit cel mai recent impuls pe 2 octombrie, cu rezultate măsurate datate de 1 octombrie - un ritm de dezvoltare care merită urmărit în sine. Pentru oricine dorește să înțeleagă cum funcționează un accelerator AI, de la o multiplicare matrice în Python până la fire, încadrarea propriu-zisă a proiectului este exactă: totul trăiește într-un singur monorepo mic pe care îl puteți citi cap la cap.
Indiferent dacă hardware-ul proiectat de agent devine o nișă serioasă sau rămâne o curiozitate de cercetare, openTPU a demonstrat ceva concret: instrumentele care permit modelelor AI să scrie software au produs acum un sistem hardware funcțional, verificat, care rulează aceleași modele. Bucla este închisă, cel puțin la scară FPGA.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →