Un proyecto pequeño pero sorprendente circula en Hacker News esta semana: openTPU, un acelerador de IA de código abierto cuyo diseño de hardware fue producido por agentes de IA. El repositorio, publicado bajo la licencia Apache 2.0 en GitHub, describe lo que sus autores llaman "un acelerador de IA de código abierto, desarrollado por IA" y, a diferencia de la mayoría de las demostraciones de este género, ejecuta modelos de producción reales con sus pesos reales en una tarjeta física que los entusiastas pueden estudiar de principio a fin.

El proyecto plantea dos preguntas, en palabras de su propio archivo README: ¿hasta dónde pueden llegar los agentes de IA en el diseño de hardware y pueden construir el chip que ejecute su propia inferencia? La segunda pregunta es la provocadora. Un sistema de IA que diseña el silicio (o en este caso, el flujo de bits FPGA) que genera sus propios tokens es un bucle que captura exactamente hacia dónde se dirige la imaginación de la industria. Para más contexto sobre esta historia, consulta nuestra novedades de IA.

Lo que realmente se ejecuta en la tarjeta

El objetivo de hardware no es atractivo para los estándares de los centros de datos: una tarjeta Inspur YPCB-00338 construida alrededor de una FPGA Xilinx Kintex-7 xc7k480t con dos canales DDR3 y un ancho de banda de memoria máximo de 17,1 GB/s. Esto está muy lejos de ser un acelerador de HBM, lo que hace que los resultados sean más interesantes, no menos.

Según las mediciones publicadas por el proyecto, el diseño ejecuta diez modelos abiertos modernos con sus pesos reales. LFM2.5-230M decodifica a 59 tokens por segundo en int8 y 85,8 tokens por segundo en 4 bits. Qwen3-0.6B administra 21,6 tokens por segundo, mientras que los modelos más grandes se reducen como se esperaba: SmolLM3-3B a 5 tokens por segundo int8, Phi-4-mini (3,8B) a 4 y Qwen3.5-4B a 5,9 tokens por segundo en 4 bits. Gemma 4 E2B y E4B también se ejecutan, manteniendo sus tablas de incrustación por capa residentes en la tarjeta.

El equipo fue más allá con modelos mixtos de expertos que superan los 4 GiB de DRAM de la tarjeta. LFM2.5-8B-A1B (8,5 mil millones de parámetros con 1,7 mil millones activos) decodifica a 10,6 tokens por segundo por parte de expertos en transmisión desde el almacenamiento del host, con el 98,5 por ciento de los usos expertos en ranuras de tarjetas y solo 5,2 MB transferidos por token. Qwen3.5-35B-A3B se ejecuta a 3,95 tokens por segundo y transmite 153 MB por token a través de PCIe. Cada configuración, afirma el README, coincide con el simulador del proyecto token por token, una afirmación de un poco de exactitud que los hackers de hardware reconocerán como la parte difícil del trabajo.

Construido como un proyecto de silicio real

Lo que separa a openTPU de las típicas demostraciones de FPGA para aficionados es la integridad de la pila. El monorepo contiene el diseño de hardware SystemVerilog, un conjunto de instrucciones personalizado, un simulador de bits exactos, un lenguaje de kernel con su propio compilador y el software host que controla la tarjeta PCIe, incluida una utilidad de monitoreo otpu-smi en el espíritu de nvidia-smi y una demostración de otpu-chat.

La imagen de producción ejecuta una unidad de matriz sistólica de cuatro columnas y un motor de flujo a 133,33 MHz, con controladores de memoria LiteDRAM calibrados por una pequeña CPU dentro del núcleo de memoria: la tarjeta calibra ambos canales DDR3 en 12 segundos sin participación del host. La versión actual, implementada desde el 1 de octubre, decodifica varios modelos entre un 8 y un 10 por ciento más rápido que la imagen anterior, al tiempo que eleva la utilización de DRAM al 91-94 por ciento del pico.

El proyecto también documenta un formato de peso de 4 bits basado en valores del FP4 con escalas de bloques de dos niveles a 4,25 bits por peso, manteniendo el encabezado del modelo de lenguaje en int8 para mayor precisión. El formato reduce los bytes por token en aproximadamente un tercio y aumenta la velocidad de decodificación entre un 40 y un 45 por ciento en algunos modelos.

El README atribuye el enfoque del proyecto a las lecciones de un repositorio anterior, auto-arch-tournament, que exploró la búsqueda de arquitectura de hardware impulsada por IA. openTPU es la aplicación de ese método a un acelerador completo, con el diseño de los agentes validado contra un simulador antes de tocar el hardware.

Por qué es importante

El rendimiento aquí no molestará a Nvidia. Un Kintex-7 con DDR3 es una clase de hardware que tiene una década de antigüedad y los modelos que ejecuta son pequeños. Pero ese es el punto que el proyecto deja implícito: todo el acelerador (RTL, conjunto de instrucciones, simulador, compilador y pila de host) es legible para una persona, en un repositorio, y fue diseñado, al menos en parte, por agentes de IA en lugar de un equipo de hardware.

En esa idea convergen tres corrientes. En primer lugar, el hardware de IA de código abierto se ha visto obstaculizado durante mucho tiempo por la gran amplitud de experiencia necesaria; un flujo de diseño impulsado por agentes reduce esa barrera. En segundo lugar, la demanda de inferencias está empujando a los investigadores hacia hardware exótico para propósitos especiales, y la búsqueda automatizada de diseños es una opción natural para explorar ese espacio. En tercer lugar, el ángulo del autohospedaje (la IA construye la máquina en la que se ejecuta) se ha convertido en una señal que la comunidad observa de cerca, a juzgar por el rápido ascenso del proyecto en Hacker News, donde reunió más de 150 puntos en cuestión de horas.

El repositorio se creó el 24 de septiembre y recibió su último impulso el 2 de octubre, con resultados medidos fechados tan recientemente como el 1 de octubre, un ritmo de desarrollo que vale la pena observar por derecho propio. Para cualquiera que quiera entender cómo funciona un acelerador de IA desde una matriz multiplicada en Python hasta los cables, el marco del proyecto es preciso: todo se encuentra en un pequeño monorepo que se puede leer de principio a fin.

Ya sea que el hardware diseñado por agentes se convierta en un nicho importante o siga siendo una curiosidad de investigación, openTPU ha demostrado algo concreto: las herramientas que permiten a los modelos de IA escribir software ahora han producido un sistema de hardware funcional y verificado que ejecuta esos mismos modelos. El circuito está cerrado, al menos a escala FPGA.

---

Mantente al Día con la IA

Las últimas noticias, análisis y avances de inteligencia artificial, en un solo lugar.

Leer más noticias de IA →