Ein kleines, aber auffälliges Projekt kursiert diese Woche bei Hacker News: openTPU, ein Open-Source-KI-Beschleuniger, dessen Hardware-Design selbst von KI-Agenten erstellt wurde. Das unter der Apache 2.0-Lizenz auf GitHub veröffentlichte Repository beschreibt, was seine Autoren „einen Open-Source-KI-Beschleuniger, entwickelt von KI“ nennen – und im Gegensatz zu den meisten Demos in diesem Genre führt es echte Produktionsmodelle mit ihren echten Gewichten auf einer physischen Karte aus, die Enthusiasten durchgängig studieren können.
Das Projekt stellt in den Worten seiner eigenen README-Datei zwei Fragen: Wie weit können KI-Agenten beim Hardware-Design gehen und können sie den Chip bauen, der ihre eigene Inferenz ausführt? Die zweite Frage ist provokativ. Ein KI-System, das das Silizium – oder in diesem Fall den FPGA-Bitstrom – entwirft, das seine eigenen Token generiert, ist eine Schleife, die genau erfasst, wohin die Vorstellungskraft der Branche geht. Weitere Informationen zu dieser Geschichte finden Sie in unserer KI-Branchenberichterstattung.
Was eigentlich auf der Karte läuft
Das Hardware-Ziel ist für Rechenzentrums-Verhältnisse unscheinbar: eine Inspur YPCB-00338-Karte, die auf einem Xilinx Kintex-7 xc7k480t FPGA mit zwei DDR3-Kanälen und einer Spitzenspeicherbandbreite von 17,1 GB/s basiert. Das ist weit entfernt von einem HBM-bestückten Beschleuniger, was die Ergebnisse interessanter und nicht weniger macht.
Den veröffentlichten Messungen des Projekts zufolge umfasst der Entwurf zehn moderne offene Modelle mit ihren tatsächlichen Gewichten. LFM2.5-230M dekodiert mit 59 Token pro Sekunde in int8 und 85,8 Token pro Sekunde in 4-Bit. Qwen3-0.6B verwaltet 21,6 Token pro Sekunde, während größere Modelle wie erwartet herunterskalieren: SmolLM3-3B mit 5 Token pro Sekunde int8, Phi-4-mini (3.8B) mit 4 und Qwen3.5-4B mit 5,9 Token pro Sekunde in 4-Bit. Gemma 4 E2B und E4B laufen ebenfalls und behalten ihre Einbettungstabellen pro Ebene auf der Karte.
Das Team ging noch einen Schritt weiter und entwickelte Modelle mit gemischten Experten, die die 4 GiB DRAM der Karte überschreiten. LFM2.5-8B-A1B – 8,5 Milliarden Parameter mit 1,7 Milliarden aktiven – dekodiert mit 10,6 Token pro Sekunde durch Streaming-Experten aus dem Hostspeicher, wobei 98,5 Prozent der Expertennutzungen auf Steckplätze auf der Karte treffen und nur 5,2 MB pro Token übertragen werden. Qwen3.5-35B-A3B läuft mit 3,95 Token pro Sekunde und streamt 153 MB pro Token über PCIe. Jede Konfiguration, heißt es in der README-Datei, stimmt Token für Token mit dem Simulator des Projekts überein – eine Behauptung der Bitgenauigkeit, die Hardware-Hacker als den schwierigen Teil der Arbeit erkennen werden.
Gebaut wie ein echtes Siliziumprojekt
Was openTPU von typischen Hobby-FPGA-Demos unterscheidet, ist die Vollständigkeit des Stacks. Das Monorepo enthält das SystemVerilog-Hardwaredesign, einen benutzerdefinierten Befehlssatz, einen bitgenauen Simulator, eine Kernel-Sprache mit eigenem Compiler und die Host-Software, die die PCIe-Karte antreibt, einschließlich eines otpu-smi-Überwachungsdienstprogramms im Geiste von nvidia-smi und einer otpu-chat-Demo.
Das Produktionsimage läuft mit einer vierspaltigen systolischen Matrixeinheit und einer Stream-Engine bei 133,33 MHz, wobei LiteDRAM-Speichercontroller von einer kleinen CPU im Speicherkern kalibriert werden – die Karte kalibriert beide DDR3-Kanäle in 12 Sekunden ohne Einbindung des Hosts. Der aktuelle Build, der seit dem 1. Oktober bereitgestellt wird, dekodiert mehrere Modelle 8 bis 10 Prozent schneller als das vorherige Image und erhöht gleichzeitig die DRAM-Auslastung auf 91 bis 94 Prozent der Spitze.
Das Projekt dokumentiert außerdem ein 4-Bit-Gewichtungsformat, das auf FP4-Werten mit zweistufigen Blockskalen bei 4,25 Bit pro Gewicht basiert, wobei der Kopf des Sprachmodells aus Gründen der Genauigkeit in int8 bleibt. Das Format reduziert die Bytes pro Token um etwa ein Drittel und erhöht die Dekodierungsgeschwindigkeit bei einigen Modellen um 40 bis 45 Prozent.
In der README-Datei wird der Ansatz des Projekts auf Lehren aus einem früheren Repository, dem Auto-Arch-Tournament, zurückgeführt, das sich mit der KI-gesteuerten Hardware-Architektursuche befasste. Bei openTPU handelt es sich um die Anwendung dieser Methode auf einen vollständigen Beschleuniger, wobei das Design der Agenten anhand eines Simulators validiert wird, bevor die Hardware überhaupt berührt wird.
Warum es wichtig ist
Die Leistung hier wird Nvidia nicht stören. Ein Kintex-7 mit DDR3 ist eine jahrzehntealte Hardwareklasse und die darauf ausgeführten Modelle sind klein. Aber genau das bringt das Projekt implizit zum Ausdruck: Der gesamte Beschleuniger – RTL, Befehlssatz, Simulator, Compiler und Host-Stack – ist für eine Person in einem Repository lesbar und wurde zumindest teilweise von KI-Agenten und nicht von einem Hardware-Team entworfen.
In dieser Idee laufen drei Strömungen zusammen. Erstens wurde Open-Source-KI-Hardware lange Zeit durch die schiere Breite des erforderlichen Fachwissens behindert. Ein agentengesteuerter Designablauf senkt diese Hürde. Zweitens drängt die Nachfrage nach Inferenzen Forscher in Richtung exotischer Spezialhardware, und die automatisierte Designsuche ist eine natürliche Ergänzung für die Erkundung dieses Bereichs. Drittens ist der Self-Hosting-Aspekt – KI baut die Maschine, auf der sie läuft – zu einem Signal geworden, das die Community genau beobachtet, wie aus dem schnellen Aufstieg des Projekts bei Hacker News hervorgeht, wo es innerhalb weniger Stunden mehr als 150 Punkte sammelte.
Das Repository wurde am 24. September erstellt und erhielt am 2. Oktober seinen letzten Schub, wobei die gemessenen Ergebnisse erst am 1. Oktober datiert wurden – ein Entwicklungstempo, das an sich schon eine Beobachtung wert ist. Für jeden, der verstehen möchte, wie ein KI-Beschleuniger von einer Matrixmultiplikation in Python bis hin zu den Drähten funktioniert, ist der Rahmen des Projekts genau: Das Ganze befindet sich in einem kleinen Monorepo, das Sie Ende für Ende lesen können.
Unabhängig davon, ob von Agenten entworfene Hardware zu einer ernsthaften Nische wird oder eine Forschungskuriosität bleibt, hat openTPU etwas Konkretes gezeigt: Die Tools, mit denen KI-Modelle Software schreiben können, haben jetzt ein funktionierendes, verifiziertes Hardwaresystem hervorgebracht, auf dem dieselben Modelle ausgeführt werden. Der Kreis ist geschlossen, zumindest im FPGA-Maßstab.
---
Bleib vorne bei KIDie neuesten KI-Nachrichten, Analysen und Durchbrüche – alles an einem Ort.
Mehr KI-Nachrichten lesen →