Na Hacker News tento týden koluje malý, ale pozoruhodný projekt: openTPU, open-source AI akcelerátor, jehož hardwarový design byl sám vytvořen agenty AI. Úložiště, publikované pod licencí Apache 2.0 na GitHubu, popisuje to, co jeho autoři nazývají „open-source AI akcelerátor, vyvinutý AI“ — a na rozdíl od většiny dem v tomto žánru provozuje skutečné produkční modely s jejich skutečnými váhami na fyzické kartě, kterou mohou nadšenci studovat od začátku do konce.
Projekt si klade dvě otázky, slovy svého vlastního README: jak daleko mohou agenti umělé inteligence zajít při návrhu hardwaru a dokážou vytvořit čip, který řídí jejich vlastní závěry? Druhá otázka je provokativní. Systém umělé inteligence navrhující křemík – nebo v tomto případě bitový tok FPGA – který generuje své vlastní tokeny, je smyčkou, která přesně zachycuje, kam směřuje představivost odvětví. For more context on this story, see our ongoing AI trends.
Co vlastně běží na kartě
Hardwarový cíl je podle standardů datových center neokázalý: karta Inspur YPCB-00338 postavená na FPGA Xilinx Kintex-7 xc7k480t se dvěma kanály DDR3 a špičkovou šířkou pásma paměti 17,1 GB/s. To je na hony vzdáleno akcelerátoru složenému z HBM, díky čemuž jsou výsledky zajímavější, ne méně.
Podle zveřejněných měření projektu běží v návrhu deset moderních otevřených modelů s jejich reálnými hmotnostmi. LFM2.5-230M dekóduje rychlostí 59 tokenů za sekundu v int8 a 85,8 tokenů za sekundu ve 4bitech. Qwen3-0.6B spravuje 21,6 tokenů za sekundu, zatímco větší modely se podle očekávání zmenšují: SmolLM3-3B při 5 tokenech za sekundu int8, Phi-4-mini (3,8B) při 4 a Qwen3.5-4B při 5,9 tokenech za sekundu ve 4bitech. Gemma 4 E2B a E4B také běží, přičemž jejich vkládací tabulky pro jednotlivé vrstvy zůstávají na kartě.
Tým šel ještě dále s modely směsice odborníků, které překračují 4 GiB DRAM karty. LFM2.5-8B-A1B — 8,5 miliardy parametrů s 1,7 miliardami aktivních — dekóduje rychlostí 10,6 tokenů za sekundu odborníky na streamování z hostitelského úložiště, přičemž 98,5 procent expertů používá zásah do slotů na kartě a pouze 5,2 MB přenesených na token. Qwen3.5-35B-A3B běží rychlostí 3,95 tokenu za sekundu, zatímco streamuje 153 MB na token přes PCIe. Každá konfigurace, uvádí README, odpovídá tokenu simulátoru projektu pro token – tvrzení o přesnosti, které hardwaroví hackeři poznají jako nejtěžší část práce.
Postaveno jako skutečný křemíkový projekt
To, co odlišuje openTPU od typických hobby ukázek FPGA, je úplnost zásobníku. Monorepo obsahuje hardwarový design SystemVerilog, vlastní instrukční sadu, bit-exaktní simulátor, jazyk jádra s vlastním kompilátorem a hostitelský software, který pohání PCIe kartu, včetně monitorovací utility otpu-smi v duchu nvidia-smi a ukázky otpu-chat.
Produkční obraz běží na čtyřsloupcové systolické maticové jednotce a stream motoru na 133,33 MHz, s řadiči paměti LiteDRAM kalibrovanými malým CPU uvnitř paměťového jádra – karta zkalibruje oba kanály DDR3 za 12 sekund bez účasti hostitele. Současné sestavení, nasazené od 1. října, dekóduje několik modelů o 8 až 10 procent rychleji než předchozí obraz a zároveň posouvá využití DRAM na 91-94 procent maxima.
Projekt také dokumentuje 4bitový formát váhy postavený na hodnotách FP4 s dvouúrovňovými blokovými stupnicemi na 4,25 bitů na váhu, přičemž hlava jazykového modelu je kvůli přesnosti udržována v int8. Formát snižuje bajty na token zhruba o třetinu a u některých modelů zvyšuje rychlost dekódování o 40 až 45 procent.
Soubor README oceňuje přístup projektu k lekcím z dřívějšího repozitáře, turnaje auto-arch-turnaj, který zkoumal hledání hardwarové architektury řízené umělou inteligencí. openTPU je aplikace této metody na kompletní akcelerátor, přičemž návrh agentů je ověřen na simulátoru dříve, než se vůbec dotknou hardwaru.
Proč na tom záleží
Výkon zde Nvidii nebude vadit. Kintex-7 s DDR3 je dekáda stará třída hardwaru a modely, které provozuje, jsou malé. Ale to je bod, který projekt implicitně ukazuje: celý akcelerátor – RTL, instrukční sada, simulátor, kompilátor a hostitelský zásobník – je čitelný pro jednu osobu, v jednom úložišti a byl navržen alespoň částečně agenty AI spíše než hardwarovým týmem.
V té představě se sbíhají tři proudy. Za prvé, open-source hardware umělé inteligence byl dlouho brzděn obrovskou šíří požadovaných odborných znalostí; návrhový tok řízený agentem tuto bariéru snižuje. Zadruhé, poptávka po odvození tlačí výzkumníky k exotickému speciálnímu hardwaru a automatizované hledání návrhu je pro průzkum tohoto prostoru přirozené. Zatřetí, úhel vlastního hostování – umělá inteligence staví stroj, na kterém běží – se stal signálem, který komunita bedlivě sleduje, soudě podle rychlého nárůstu projektu na Hacker News, kde během několika hodin nasbíral více než 150 bodů.
Úložiště bylo vytvořeno 24. září a svůj poslední impuls obdrželo 2. října s naměřenými výsledky z 1. října – tempo vývoje, které stojí za to sledovat samo o sobě. Pro každého, kdo chce porozumět tomu, jak funguje akcelerátor AI od maticového násobení v Pythonu až po dráty, je vlastní rámování projektu přesné: celá věc žije v jednom malém monorepo, které můžete číst od konce do konce.
Ať už se hardware navržený agenty stane vážným výklenkem nebo zůstane výzkumnou kuriozitou, openTPU předvedl něco konkrétního: nástroje, které umožňují AI modelům psát software, nyní vytvořily fungující, ověřený hardwarový systém, který provozuje stejné modely. Smyčka je uzavřená, alespoň v měřítku FPGA.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →