Ett litet men slående projekt cirkulerar på Hacker News den här veckan: openTPU, en AI-accelerator med öppen källkod vars hårdvarudesign själv producerades av AI-agenter. Förvaret, publicerat under Apache 2.0-licensen på GitHub, beskriver vad dess författare kallar "en open-source AI-accelerator, utvecklad av AI" - och till skillnad från de flesta demos i den här genren, kör den riktiga produktionsmodeller med sina verkliga vikter på ett fysiskt kort som entusiaster kan studera från början.
Projektet ställer två frågor, med sina egna README:s ord: hur långt kan AI-agenter gå i hårdvarudesign, och kan de bygga chippet som kör sina egna slutsatser? Den andra frågan är den provocerande. Ett AI-system som designar kislet – eller i det här fallet FPGA-bitströmmen – som genererar sina egna tokens är en loop som fångar exakt vart branschens fantasi är på väg. For more context on this story, see our ongoing latest AI developments.
Vad som faktiskt körs på kortet
Hårdvarumålet är oglamoröst enligt datacenterstandarder: ett Inspur YPCB-00338-kort byggt kring en Xilinx Kintex-7 xc7k480t FPGA med två DDR3-kanaler och en 17,1 GB/s toppminnesbandbredd. Det är långt ifrån en HBM-stackad accelerator, vilket gör resultaten mer intressanta, inte mindre.
Enligt projektets publicerade mått kör designen tio moderna öppna modeller med sina riktiga vikter. LFM2.5-230M avkodar med 59 tokens per sekund i int8 och 85,8 tokens per sekund i 4-bitars. Qwen3-0.6B klarar 21,6 tokens per sekund, medan större modeller skalar ner som förväntat: SmolLM3-3B med 5 tokens per sekund int8, Phi-4-mini (3.8B) vid 4 och Qwen3.5-4B vid 5,9 tokens per sekund i 4-bitars. Gemma 4 E2B och E4B körs också och behåller sina inbäddningsbord per lager på kortet.
Teamet gick längre med modeller av blandning av experter som överstiger kortets 4 GiB DRAM. LFM2.5-8B-A1B — 8,5 miljarder parametrar med 1,7 miljarder aktiva — avkodar med 10,6 tokens per sekund genom att strömma experter från värdlagring, med 98,5 procent av expertanvändning som träffar kortplatser och endast 5,2 MB överförs per token. Qwen3.5-35B-A3B körs med 3,95 tokens per sekund medan den streamar 153 MB per token över PCIe. Varje konfiguration, enligt README, matchar projektets simulatortoken för token - ett lite exakt påstående som hårdvaruhackare kommer att känna igen som den svåra delen av jobbet.
Byggt som ett riktigt kiselprojekt
Det som skiljer openTPU från typiska hobby-FPGA-demos är stackens fullständighet. Monorepo innehåller SystemVerilog-hårdvarudesignen, en anpassad instruktionsuppsättning, en bitexakt simulator, ett kärnspråk med en egen kompilator och värdmjukvaran som driver PCIe-kortet, inklusive ett otpu-smi-övervakningsverktyg i nvidia-smi-andan och en otpu-chat-demo.
Produktionsbilden kör en systolisk matrisenhet med fyra kolumner och en streammotor på 133,33 MHz, med LiteDRAM-minneskontroller kalibrerade av en liten CPU inuti minneskärnan — kortet kalibrerar båda DDR3-kanalerna på 12 sekunder utan värdinblandning. Den nuvarande versionen, implementerad sedan 1 oktober, avkodar flera modeller 8 till 10 procent snabbare än föregående bild samtidigt som DRAM-användningen pressas till 91-94 procent av topp.
Projektet dokumenterar också ett 4-bitars viktformat byggt på FP4-värden med blockskalor på två nivåer på 4,25 bitar per vikt, vilket håller språkmodellhuvudet i int8 för noggrannhet. Formatet minskar byte per token med ungefär en tredjedel och höjer avkodningshastigheten med 40 till 45 procent på vissa modeller.
README krediterar projektets inställning till lärdomar från ett tidigare arkiv, auto-arch-turnering, som utforskade AI-driven maskinvaruarkitektursökning. openTPU är tillämpningen av den metoden på en komplett accelerator, med agenternas design validerad mot en simulator innan de någonsin rör vid hårdvara.
Varför det är viktigt
Prestandan här kommer inte att störa Nvidia. En Kintex-7 med DDR3 är en decennium gammal hårdvaraklass, och modellerna som den kör är små. Men det är poängen som projektet uttrycker underförstått: hela acceleratorn – RTL, instruktionsuppsättning, simulator, kompilator och värdstack – är läsbar för en person, i ett arkiv, och den designades åtminstone delvis av AI-agenter snarare än ett hårdvaruteam.
Tre strömningar sammanfaller i den idén. För det första har AI-hårdvara med öppen källkod länge hindrats av den stora bredd av expertis som krävs; ett agentdrivet designflöde sänker den barriären. För det andra, efterfrågan på slutsatser driver forskare mot exotisk hårdvara för speciella ändamål, och automatisk designsökning är en naturlig passform för att utforska det utrymmet. För det tredje har den självvärdande vinkeln - AI som bygger maskinen den körs på - blivit en signal som samhället bevakar noga, att döma av projektets snabba uppgång på Hacker News, där det samlade mer än 150 poäng inom några timmar.
Förvaret skapades den 24 september och fick sin senaste push den 2 oktober, med mätresultat daterade så sent som den 1 oktober – en utvecklingstakt i sig värd att titta på. För alla som vill förstå hur en AI-accelerator fungerar från en matrismultiplicering i Python ner till ledningarna, är projektets egen inramning korrekt: det hela lever i en liten monorepo som du kan läsa från början till slut.
Oavsett om agentdesignad hårdvara blir en seriös nisch eller förblir en forskningsnyfikenhet, har openTPU visat något konkret: verktygen som låter AI-modeller skriva mjukvara har nu producerat ett fungerande, verifierat hårdvarusystem som kör samma modeller. Slingan är sluten, åtminstone i FPGA-skala.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →