Er circuleert deze week een klein maar opvallend project op Hacker News: openTPU, een open-source AI-versneller waarvan het hardware-ontwerp zelf is geproduceerd door AI-agenten. De repository, gepubliceerd onder de Apache 2.0-licentie op GitHub, beschrijft wat de auteurs noemen "een open-source AI-accelerator, ontwikkeld door AI" - en in tegenstelling tot de meeste demo's in dit genre draait het echte productiemodellen met hun echte gewichten op een fysieke kaart die liefhebbers van begin tot eind kunnen bestuderen.
Het project stelt twee vragen, in de woorden van zijn eigen README: hoe ver kunnen AI-agenten gaan in het ontwerpen van hardware, en kunnen ze de chip bouwen die hun eigen gevolgtrekkingen maakt? De tweede vraag is provocerend. Een AI-systeem dat het silicium ontwerpt – of in dit geval de FPGA-bitstream – dat zijn eigen tokens genereert, is een lus die precies weergeeft waar de verbeelding van de industrie naartoe gaat. Voor meer context over dit verhaal, zie ons meer AI-verhalen.
Wat er feitelijk op de kaart staat
Het hardwaredoel is niet glamoureus volgens datacenterstandaarden: een Inspur YPCB-00338-kaart gebouwd rond een Xilinx Kintex-7 xc7k480t FPGA met twee DDR3-kanalen en een piekgeheugenbandbreedte van 17,1 GB/s. Dat staat ver af van een HBM-gestapelde accelerator, wat de resultaten interessanter maakt, niet minder.
Volgens de gepubliceerde afmetingen van het project bestaat het ontwerp uit tien moderne open modellen met hun werkelijke gewicht. LFM2.5-230M decodeert met 59 tokens per seconde in int8 en 85,8 tokens per seconde in 4-bit. Qwen3-0.6B beheert 21,6 tokens per seconde, terwijl grotere modellen zoals verwacht worden geschaald: SmolLM3-3B met 5 tokens per seconde int8, Phi-4-mini (3,8B) met 4 en Qwen3.5-4B met 5,9 tokens per seconde in 4-bit. Gemma 4 E2B en E4B draaien ook, waarbij de inbeddingstabellen per laag op de kaart blijven staan.
Het team ging verder met modellen met een mix van experts die de 4 GiB DRAM van de kaart overschrijden. LFM2.5-8B-A1B – 8,5 miljard parameters waarvan 1,7 miljard actief – decodeert met 10,6 tokens per seconde door experts vanuit hostopslag te streamen, waarbij 98,5 procent van de experts gebruik maakt van on-card slots en slechts 5,2 MB wordt overgedragen per token. Qwen3.5-35B-A3B draait op 3,95 tokens per seconde en streamt 153 MB per token via PCIe. Elke configuratie, zo stelt de README, komt overeen met de simulator van het project, token voor token – een bit-exactheidsclaim die hardwarehackers zullen herkennen als het moeilijkste deel van het werk.
Gebouwd als een echt siliciumproject
Wat openTPU onderscheidt van typische hobby-FPGA-demo's is de volledigheid van de stapel. De monorepo bevat het hardwareontwerp van SystemVerilog, een aangepaste instructieset, een bit-exacte simulator, een kerneltaal met een eigen compiler en de hostsoftware die de PCIe-kaart aanstuurt, inclusief een otpu-smi monitoringhulpprogramma in de geest van nvidia-smi en een otpu-chat-demo.
Het productie-image draait op een systolische matrixeenheid met vier kolommen en een stream-engine op 133,33 MHz, waarbij LiteDRAM-geheugencontrollers worden gekalibreerd door een kleine CPU in de geheugenkern - de kaart kalibreert beide DDR3-kanalen in 12 seconden zonder tussenkomst van de host. De huidige build, geïmplementeerd sinds 1 oktober, decodeert verschillende modellen 8 tot 10 procent sneller dan de vorige image, terwijl het DRAM-gebruik naar 91-94 procent van de piek wordt geduwd.
Het project documenteert ook een 4-bits gewichtsformaat gebouwd op FP4-waarden met blokschalen op twee niveaus van 4,25 bits per gewicht, waarbij de taalmodelkop in int8 blijft voor nauwkeurigheid. Het formaat vermindert het aantal bytes per token met ongeveer een derde en verhoogt de decodeersnelheid op sommige modellen met 40 tot 45 procent.
De README dankt de aanpak van het project aan lessen uit een eerdere repository, auto-arch-toernooi, waarin AI-gestuurd zoeken naar hardware-architectuur werd verkend. openTPU is de toepassing van die methode op een complete versneller, waarbij het ontwerp van de agenten wordt gevalideerd aan de hand van een simulator voordat ze ooit hardware aanraken.
Waarom het ertoe doet
De prestaties hier zullen Nvidia niet storen. Een Kintex-7 met DDR3 is een hardwareklasse van tien jaar oud, en de modellen die erop draaien zijn klein. Maar dat is het punt dat het project impliciet maakt: de hele accelerator – RTL, instructieset, simulator, compiler en hoststack – is leesbaar voor één persoon, in één repository, en is op zijn minst gedeeltelijk ontworpen door AI-agenten in plaats van door een hardwareteam.
In dat idee komen drie stromingen samen. Ten eerste wordt open-source AI-hardware lange tijd belemmerd door de enorme omvang van de vereiste expertise; een door agenten aangestuurde ontwerpstroom verlaagt die barrière. Ten tweede dwingt de vraag naar gevolgtrekkingen onderzoekers naar exotische hardware voor speciale doeleinden, en geautomatiseerd zoeken naar ontwerpen is een natuurlijke oplossing voor het verkennen van die ruimte. Ten derde is de zelfhosting-invalshoek – AI die de machine bouwt waarop het draait – een signaal geworden waar de gemeenschap nauwlettend op let, getuige de snelle opkomst van het project op Hacker News, waar het binnen enkele uren meer dan 150 punten verzamelde.
De repository werd op 24 september gecreëerd en kreeg zijn laatste push op 2 oktober, met gemeten resultaten die pas op 1 oktober dateerden – een ontwikkelingstempo dat op zichzelf al de moeite waard is om te bekijken. Voor iedereen die wil begrijpen hoe een AI-versneller werkt, van een matrixvermenigvuldiging in Python tot aan de draden, is de eigen framing van het project accuraat: het geheel bevindt zich in één kleine monorepo die je van begin tot eind kunt lezen.
Of door agenten ontworpen hardware nu een serieuze niche wordt of een onderzoeksnieuwsgierigheid blijft, openTPU heeft iets concreets aangetoond: de tools waarmee AI-modellen software kunnen schrijven, hebben nu een werkend, geverifieerd hardwaresysteem geproduceerd dat dezelfde modellen draait. De lus is gesloten, tenminste op FPGA-schaal.
---
Blijf Voorop met AIHet laatste AI-nieuws, analyses en doorbraken — allemaal op één plek.
Lees meer AI-nieuws →