Un projet petit mais marquant circule cette semaine sur Hacker News : openTPU, un accélérateur d'IA open source dont la conception matérielle a été elle-même réalisée par des agents d'IA. Le référentiel, publié sous la licence Apache 2.0 sur GitHub, décrit ce que ses auteurs appellent « un accélérateur d'IA open source, développé par AI » – et contrairement à la plupart des démos de ce genre, il exécute de vrais modèles de production avec leurs poids réels sur une carte physique que les passionnés peuvent étudier de bout en bout.
Le projet pose deux questions, selon les termes de son propre README : jusqu'où les agents d'IA peuvent-ils aller dans la conception matérielle et peuvent-ils construire la puce qui exécute leur propre inférence ? La deuxième question est provocatrice. Un système d’IA concevant le silicium – ou dans ce cas, le flux binaire FPGA – qui génère ses propres jetons est une boucle qui capture exactement où se dirige l’imagination de l’industrie. Pour plus de contexte sur cette histoire, consultez notre plus d'articles sur l'IA.
Ce qui s'exécute réellement sur la carte
La cible matérielle n'est pas glamour par rapport aux normes des centres de données : une carte Inspur YPCB-00338 construite autour d'un FPGA Xilinx Kintex-7 xc7k480t avec deux canaux DDR3 et une bande passante mémoire maximale de 17,1 Go/s. On est loin d’un accélérateur superposé HBM, qui rend les résultats plus intéressants, pas moins.
Selon les mesures publiées du projet, la conception utilise dix modèles ouverts modernes avec leurs poids réels. LFM2.5-230M décode à 59 jetons par seconde en int8 et 85,8 jetons par seconde en 4 bits. Qwen3-0.6B gère 21,6 jetons par seconde, tandis que les modèles plus grands diminuent comme prévu : SmolLM3-3B à 5 jetons par seconde en int8, Phi-4-mini (3,8B) à 4 et Qwen3.5-4B à 5,9 jetons par seconde en 4 bits. Gemma 4 E2B et E4B fonctionnent également, en gardant leurs tables d'intégration par couche résidant sur la carte.
L'équipe est allée plus loin avec des modèles mixtes qui dépassent les 4 Go de DRAM de la carte. LFM2.5-8B-A1B — 8,5 milliards de paramètres dont 1,7 milliards actifs — décode à 10,6 jetons par seconde par des experts en streaming à partir du stockage hôte, avec 98,5 % des utilisations expertes atteignant les emplacements sur carte et seulement 5,2 Mo transférés par jeton. Qwen3.5-35B-A3B fonctionne à 3,95 jetons par seconde tout en diffusant 153 Mo par jeton sur PCIe. Chaque configuration, indique le README, correspond au jeton du simulateur du projet pour le jeton – une affirmation très précise que les pirates informatiques reconnaîtront comme la partie la plus difficile du travail.
Construit comme un véritable projet de silicium
Ce qui différencie openTPU des démos FPGA classiques, c'est l'exhaustivité de la pile. Le monorepo contient la conception matérielle SystemVerilog, un jeu d'instructions personnalisé, un simulateur au bit exact, un langage de noyau avec son propre compilateur et le logiciel hôte qui pilote la carte PCIe, y compris un utilitaire de surveillance otpu-smi dans l'esprit de nvidia-smi et une démo otpu-chat.
L'image de production exécute une unité matricielle systolique à quatre colonnes et un moteur de flux à 133,33 MHz, avec des contrôleurs de mémoire LiteDRAM calibrés par un petit processeur à l'intérieur du cœur de mémoire - la carte calibre les deux canaux DDR3 en 12 secondes sans implication de l'hôte. La version actuelle, déployée depuis le 1er octobre, décode plusieurs modèles 8 à 10 % plus rapidement que l'image précédente tout en poussant l'utilisation de la DRAM à 91-94 % du pic.
Le projet documente également un format de poids de 4 bits construit sur les valeurs FP4 avec des échelles de blocs à deux niveaux à 4,25 bits par poids, gardant la tête du modèle de langage en int8 pour plus de précision. Le format réduit le nombre d'octets par jeton d'environ un tiers et augmente la vitesse de décodage de 40 à 45 % sur certains modèles.
Le README attribue l'approche du projet aux leçons d'un référentiel antérieur, auto-arch-tournament, qui explorait la recherche d'architecture matérielle basée sur l'IA. openTPU est l'application de cette méthode à un accélérateur complet, la conception des agents étant validée par rapport à un simulateur avant même de toucher au matériel.
Pourquoi c'est important
Les performances ici ne dérangeront pas Nvidia. Un Kintex-7 avec DDR3 est une classe de matériel vieille de dix ans et les modèles qu'il exécute sont petits. Mais c’est ce que souligne implicitement le projet : l’ensemble de l’accélérateur – RTL, jeu d’instructions, simulateur, compilateur et pile hôte – est lisible par une seule personne, dans un seul référentiel, et il a été conçu au moins en partie par des agents IA plutôt que par une équipe matérielle.
Trois courants convergent autour de cette idée. Premièrement, le matériel d’IA open source a longtemps été entravé par l’étendue de l’expertise requise ; un flux de conception piloté par les agents abaisse cette barrière. Deuxièmement, la demande d’inférence pousse les chercheurs vers du matériel exotique à usage spécifique, et la recherche automatisée de conceptions est un choix naturel pour explorer cet espace. Troisièmement, l’aspect de l’auto-hébergement – l’IA construisant la machine sur laquelle il fonctionne – est devenu un signal que la communauté surveille de près, à en juger par l’essor rapide du projet sur Hacker News, où il a rassemblé plus de 150 points en quelques heures.
Le référentiel a été créé le 24 septembre et a reçu sa dernière version le 2 octobre, avec des résultats mesurés datant du 1er octobre – un rythme de développement qui mérite d'être surveillé en soi. Pour tous ceux qui veulent comprendre comment fonctionne un accélérateur d'IA, depuis une multiplication matricielle en Python jusqu'aux fils, le cadrage du projet est précis : le tout réside dans un petit monorepo que vous pouvez lire bout à bout.
Que le matériel conçu par des agents devienne une niche sérieuse ou reste une curiosité de recherche, openTPU a démontré quelque chose de concret : les outils qui permettent aux modèles d'IA d'écrire des logiciels ont désormais produit un système matériel fonctionnel et vérifié qui exécute ces mêmes modèles. La boucle est fermée, du moins à l’échelle FPGA.
---
Restez à la Pointe de l'IALes dernières actualités, analyses et percées en IA — au même endroit.
Lire plus d'actualités IA →