W tym tygodniu w Hacker News krąży mały, ale uderzający projekt: openTPU, akcelerator sztucznej inteligencji typu open source, którego projekt sprzętowy został sam opracowany przez agentów sztucznej inteligencji. Repozytorium, opublikowane na licencji Apache 2.0 w serwisie GitHub, opisuje to, co jego autorzy nazywają „akceleratorem sztucznej inteligencji typu open source opracowanym przez sztuczną inteligencję” i w przeciwieństwie do większości wersji demonstracyjnych tego gatunku uruchamia rzeczywiste modele produkcyjne z ich rzeczywistymi ciężarami na fizycznej karcie, którą entuzjaści mogą przestudiować od początku do końca.

W ramach projektu zadano dwa pytania, zgodnie z własnym plikiem README: jak daleko agenci sztucznej inteligencji mogą posunąć się w projektowaniu sprzętu i czy mogą zbudować chip, który będzie przeprowadzał własne wnioski? Drugie pytanie jest prowokacyjne. System sztucznej inteligencji projektujący krzem — lub w tym przypadku strumień bitów FPGA — generujący własne tokeny, to pętla, która dokładnie rejestruje, dokąd zmierza wyobraźnia branży. Więcej kontekstu na ten temat znajdziesz w naszych najnowsze osiągnięcia AI.

Co faktycznie działa na karcie

Cel sprzętowy jest mało efektowny jak na standardy centrów danych: karta Inspur YPCB-00338 zbudowana na bazie układu FPGA Xilinx Kintex-7 xc7k480t z dwoma kanałami DDR3 i szczytową przepustowością pamięci 17,1 GB/s. To daleko od akceleratora wyposażonego w HBM, co sprawia, że ​​wyniki są bardziej interesujące, a nie mniej.

Zgodnie z opublikowanymi pomiarami projektu, w projekcie wykorzystuje się dziesięć nowoczesnych otwartych modeli z ich rzeczywistymi ciężarami. LFM2.5-230M dekoduje z szybkością 59 tokenów na sekundę w trybie int8 i 85,8 tokenów na sekundę w trybie 4-bitowym. Qwen3-0.6B zarządza 21,6 tokenów na sekundę, podczas gdy większe modele skalują się w dół zgodnie z oczekiwaniami: SmolLM3-3B przy 5 tokenach na sekundę w int8, Phi-4-mini (3,8B) przy 4 i Qwen3.5-4B przy 5,9 tokenów na sekundę w trybie 4-bitowym. Gemma 4 E2B i E4B również działają, zachowując tabele osadzania poszczególnych warstw na karcie.

Zespół poszedł dalej, tworząc modele złożone z mieszanki ekspertów, które przekraczają 4 GiB pamięci DRAM karty. LFM2.5-8B-A1B — 8,5 miliarda parametrów przy 1,7 miliarda aktywnych — dekoduje z szybkością 10,6 tokenów na sekundę poprzez przesyłanie strumieniowe ekspertów z pamięci hosta, przy czym 98,5 procent zastosowań ekspertów trafia do gniazd kart i tylko 5,2 MB przesyłanych na token. Qwen3.5-35B-A3B działa z szybkością 3,95 tokenów na sekundę podczas przesyłania strumieniowego 153 MB na token przez PCIe. Jak stwierdza plik README, każda konfiguracja odpowiada tokenowi symulatora projektu po tokenie — co jest twierdzeniem dotyczącym dokładności bitowej, które hakerzy sprzętowi uznają za trudną część pracy.

Zbudowany jak prawdziwy projekt silikonowy

Tym, co odróżnia openTPU od typowych, hobbystycznych demonstracji FPGA, jest kompletność stosu. Monorepo zawiera projekt sprzętowy SystemVerilog, niestandardowy zestaw instrukcji, symulator bit-dokładny, język jądra z własnym kompilatorem i oprogramowanie hosta sterujące kartą PCIe, w tym narzędzie monitorujące otpu-smi w duchu nvidia-smi i wersję demonstracyjną otpu-chat.

Obraz produkcyjny wykorzystuje czterokolumnową matrycę skurczową i silnik strumieniowy o częstotliwości 133,33 MHz, z kontrolerami pamięci LiteDRAM skalibrowanymi przez mały procesor wewnątrz rdzenia pamięci – karta kalibruje oba kanały DDR3 w 12 sekund bez udziału hosta. Obecna wersja, wdrożona od 1 października, dekoduje kilka modeli od 8 do 10 procent szybciej niż poprzednia wersja, jednocześnie zwiększając wykorzystanie pamięci DRAM do 91–94 procent wartości szczytowych.

Projekt dokumentuje także 4-bitowy format wag zbudowany na wartościach FP4 z dwupoziomowymi skalami blokowymi przy 4,25 bitach na wagę, utrzymując głowicę modelu języka w int8 dla zapewnienia dokładności. Format ten zmniejsza liczbę bajtów na token o około jedną trzecią i w niektórych modelach zwiększa prędkość dekodowania o 40–45 procent.

W pliku README podejście projektu opiera się na wnioskach z wcześniejszego repozytorium, turnieju auto-arch, w którym badano wyszukiwanie architektury sprzętowej opartej na sztucznej inteligencji. openTPU to zastosowanie tej metody do kompletnego akceleratora, przy czym projekt agentów jest sprawdzany na symulatorze, zanim w ogóle dotknie się sprzętu.

Dlaczego to ma znaczenie

Wydajność tutaj nie sprawi Nvidii kłopotów. Kintex-7 z pamięcią DDR3 to klasa sprzętu mająca dekadę, a modele na nim obsługiwane są małe. Ale to właśnie podkreśla projekt: cały akcelerator — RTL, zestaw instrukcji, symulator, kompilator i stos hostów — jest czytelny dla jednej osoby w jednym repozytorium i został zaprojektowany przynajmniej częściowo przez agentów sztucznej inteligencji, a nie zespół sprzętowy.

W tej idei zbiegają się trzy nurty. Po pierwsze, sprzęt AI typu open source od dawna był hamowany przez sam szeroki zakres wymaganej wiedzy specjalistycznej; przepływ projektowania oparty na agentach obniża tę barierę. Po drugie, zapotrzebowanie na wnioskowanie popycha badaczy w stronę egzotycznego sprzętu specjalnego przeznaczenia, a automatyczne wyszukiwanie projektów w naturalny sposób nadaje się do badania tej przestrzeni. Po trzecie, aspekt samodzielnego hostingu – sztuczna inteligencja budująca maszynę, na której działa – stał się sygnałem, któremu społeczność uważnie się przygląda, sądząc po szybkim rozwoju projektu w Hacker News, gdzie w ciągu kilku godzin zebrał ponad 150 punktów.

Repozytorium utworzono 24 września, a ostatnią aktualizację otrzymało 2 października, a wyniki pomiarów datowano dopiero 1 października – tempo rozwoju samo w sobie jest warte obserwacji. Dla każdego, kto chce zrozumieć, jak działa akcelerator AI, począwszy od mnożenia macierzy w Pythonie aż do przewodów, ramy projektu są dokładne: całość mieści się w jednym małym repozytorium, które można przeczytać od końca do końca.

Niezależnie od tego, czy sprzęt zaprojektowany przez agentów stanie się poważną niszą, czy pozostanie ciekawostką badawczą, openTPU pokazało coś konkretnego: narzędzia, które pozwalają modelom AI pisać oprogramowanie, stworzyły teraz działający, zweryfikowany system sprzętowy, który obsługuje te same modele. Pętla jest zamknięta, przynajmniej w skali FPGA.

---

Bądź na Bieżąco z AI

Najnowsze wiadomości, analizy i przełomy w dziedzinie AI — wszystko w jednym miejscu.

Czytaj więcej wiadomości AI →