Questa settimana su Hacker News circola un progetto piccolo ma sorprendente: openTPU, un acceleratore AI open source il cui design hardware è stato esso stesso prodotto da agenti AI. Il repository, pubblicato sotto la licenza Apache 2.0 su GitHub, descrive quello che i suoi autori chiamano "un acceleratore AI open source, sviluppato da AI" - e a differenza della maggior parte delle demo di questo genere, esegue modelli di produzione reali con i loro pesi reali su una scheda fisica che gli appassionati possono studiare dall'inizio alla fine.

Il progetto pone due domande, secondo le parole del suo stesso README: fino a che punto possono spingersi gli agenti di intelligenza artificiale nella progettazione dell'hardware e possono costruire il chip che esegue la propria inferenza? La seconda domanda è quella provocatoria. Un sistema di intelligenza artificiale che progetta il silicio (o, in questo caso, il bitstream FPGA) che genera i propri token è un ciclo che cattura esattamente dove si sta dirigendo l'immaginazione del settore. Per maggiori informazioni su questa storia, consulta la nostra ultimi sviluppi nell'IA.

Cosa viene effettivamente eseguito sulla scheda

L'obiettivo hardware non è affascinante per gli standard dei data center: una scheda Inspur YPCB-00338 costruita attorno a un FPGA Xilinx Kintex-7 xc7k480t con due canali DDR3 e una larghezza di banda di memoria di picco di 17,1 GB/s. Questo è molto diverso da un acceleratore stacked della HBM, che rende i risultati più interessanti, non meno.

Secondo le misurazioni pubblicate dal progetto, il progetto prevede dieci moderni modelli aperti con i loro pesi reali. LFM2.5-230M decodifica a 59 token al secondo in int8 e 85,8 token al secondo a 4 bit. Qwen3-0.6B gestisce 21,6 token al secondo, mentre i modelli più grandi si ridimensionano come previsto: SmolLM3-3B a 5 token al secondo int8, Phi-4-mini (3.8B) a 4 e Qwen3.5-4B a 5,9 token al secondo in 4 bit. Anche Gemma 4 E2B ed E4B funzionano, mantenendo le tabelle di incorporamento per livello residenti sulla scheda.

Il team è andato oltre con modelli misti di esperti che superano i 4 GiB di DRAM della scheda. LFM2.5-8B-A1B - 8,5 miliardi di parametri con 1,7 miliardi attivi - decodifica a 10,6 token al secondo trasmettendo in streaming esperti dallo storage host, con il 98,5% degli usi esperti che raggiungono gli slot su scheda e solo 5,2 MB trasferiti per token. Qwen3.5-35B-A3B funziona a 3,95 token al secondo durante lo streaming di 153 MB per token su PCIe. Ogni configurazione, afferma il README, corrisponde al token del simulatore del progetto per token: un'affermazione di precisione in bit che gli hacker hardware riconosceranno come la parte difficile del lavoro.

Costruito come un vero progetto in silicio

Ciò che distingue openTPU dalle tipiche demo FPGA per hobby è la completezza dello stack. Il monorepo contiene il design hardware SystemVerilog, un set di istruzioni personalizzato, un simulatore bit-esatto, un linguaggio del kernel con il proprio compilatore e il software host che guida la scheda PCIe, inclusa un'utilità di monitoraggio otpu-smi nello spirito di nvidia-smi e una demo otpu-chat.

L'immagine di produzione utilizza un'unità di matrice sistolica a quattro colonne e un motore di flusso a 133,33 MHz, con controller di memoria LiteDRAM calibrati da una piccola CPU all'interno del core di memoria: la scheda calibra entrambi i canali DDR3 in 12 secondi senza coinvolgimento dell'host. L'attuale build, implementata dal 1° ottobre, decodifica diversi modelli dall'8 al 10% più velocemente rispetto all'immagine precedente, spingendo l'utilizzo della DRAM al 91-94% del picco.

Il progetto documenta inoltre un formato di peso a 4 bit costruito su valori FP4 con scale di blocco a due livelli a 4,25 bit per peso, mantenendo l'head del modello linguistico in int8 per la precisione. Il formato riduce i byte per token di circa un terzo e aumenta la velocità di decodifica del 40-45% su alcuni modelli.

Il README attribuisce l'approccio del progetto alle lezioni di un repository precedente, auto-arch-tournament, che esplorava la ricerca dell'architettura hardware basata sull'intelligenza artificiale. openTPU è l'applicazione di questo metodo a un acceleratore completo, con la progettazione degli agenti convalidata rispetto a un simulatore prima ancora di toccare l'hardware.

Perché è importante

Le prestazioni qui non disturberanno Nvidia. Un Kintex-7 con DDR3 è una classe di hardware vecchia di dieci anni e i modelli che gestisce sono piccoli. Ma questo è il punto implicito del progetto: l’intero acceleratore – RTL, set di istruzioni, simulatore, compilatore e stack host – è leggibile da una persona, in un repository, ed è stato progettato almeno in parte da agenti AI piuttosto che da un team hardware.

Tre correnti convergono in questa idea. Innanzitutto, l’hardware AI open source è stato a lungo ostacolato dall’ampiezza delle competenze richieste; un flusso di progettazione guidato dagli agenti abbassa tale barriera. In secondo luogo, la domanda di inferenza sta spingendo i ricercatori verso hardware esotici per scopi speciali, e la ricerca di progetti automatizzati è una soluzione naturale per esplorare quello spazio. In terzo luogo, l’aspetto del self-hosting – l’intelligenza artificiale che costruisce la macchina su cui gira – è diventato un segnale che la comunità osserva da vicino, a giudicare dalla rapida ascesa del progetto su Hacker News, dove ha raccolto più di 150 punti in poche ore.

Il repository è stato creato il 24 settembre e ha ricevuto il suo ultimo impulso il 2 ottobre, con risultati misurati risalenti al 1° ottobre: ​​un ritmo di sviluppo che vale la pena tenere d'occhio. Per chiunque voglia capire come funziona un acceleratore AI da una matrice moltiplicata in Python fino ai fili, l'inquadramento stesso del progetto è accurato: il tutto vive in un piccolo monorepo che puoi leggere dall'inizio alla fine.

Sia che l’hardware progettato da agenti diventi una nicchia seria o rimanga una curiosità di ricerca, openTPU ha dimostrato qualcosa di concreto: gli strumenti che consentono ai modelli di intelligenza artificiale di scrivere software hanno ora prodotto un sistema hardware funzionante e verificato che esegue quegli stessi modelli. Il ciclo è chiuso, almeno su scala FPGA.

---

Rimani Aggiornato sull'IA

Le ultime notizie, analisi e scoperte sull'intelligenza artificiale — tutto in un posto.

Leggi altre notizie sull'IA →