Um projeto pequeno, mas impressionante, está circulando no Hacker News esta semana: openTPU, um acelerador de IA de código aberto cujo design de hardware foi produzido por agentes de IA. O repositório, publicado sob a licença Apache 2.0 no GitHub, descreve o que seus autores chamam de “um acelerador de IA de código aberto, desenvolvido pela IA” – e ao contrário da maioria das demos deste gênero, ele executa modelos de produção reais com seus pesos reais em um cartão físico que os entusiastas podem estudar de ponta a ponta.
O projeto faz duas perguntas, nas palavras de seu próprio README: até onde os agentes de IA podem ir no design de hardware e eles podem construir o chip que executa sua própria inferência? A segunda pergunta é provocativa. Um sistema de IA que projeta o silício – ou, neste caso, o fluxo de bits do FPGA – que gera seus próprios tokens é um loop que captura exatamente para onde a imaginação da indústria está indo. Para mais contexto sobre esta história, confira nossa notícias de IA.
O que realmente funciona no cartão
O alvo de hardware não é glamoroso para os padrões de data center: uma placa Inspur YPCB-00338 construída em torno de um FPGA Xilinx Kintex-7 xc7k480t com dois canais DDR3 e uma largura de banda de memória de pico de 17,1 GB/s. Isso está muito longe de ser um acelerador empilhado pela HBM, o que torna os resultados mais interessantes, e não menos.
De acordo com as medidas publicadas no projeto, o projeto roda dez modernos modelos abertos com seus pesos reais. LFM2.5-230M decodifica 59 tokens por segundo em int8 e 85,8 tokens por segundo em 4 bits. Qwen3-0.6B gerencia 21,6 tokens por segundo, enquanto modelos maiores diminuem conforme esperado: SmolLM3-3B a 5 tokens por segundo int8, Phi-4-mini (3,8B) a 4 e Qwen3.5-4B a 5,9 tokens por segundo em 4 bits. Gemma 4 E2B e E4B também são executados, mantendo suas tabelas de incorporação por camada residentes no cartão.
A equipe foi além com modelos mistos de especialistas que excedem os 4 GiB de DRAM da placa. LFM2.5-8B-A1B — 8,5 bilhões de parâmetros com 1,7 bilhão ativos — decodifica a 10,6 tokens por segundo por especialistas em streaming do armazenamento host, com 98,5% dos usos especializados atingindo slots no cartão e apenas 5,2 MB transferidos por token. Qwen3.5-35B-A3B roda a 3,95 tokens por segundo enquanto transmite 153 MB por token via PCIe. Cada configuração, afirma o README, corresponde ao token do simulador do projeto por token – uma afirmação de exatidão de bits que os hackers de hardware reconhecerão como a parte difícil do trabalho.
Construído como um verdadeiro projeto de silício
O que separa o openTPU das demonstrações típicas de FPGA de hobby é a integridade da pilha. O monorepo contém o design de hardware SystemVerilog, um conjunto de instruções personalizado, um simulador de bit exato, uma linguagem de kernel com seu próprio compilador e o software host que aciona a placa PCIe, incluindo um utilitário de monitoramento otpu-smi no espírito de nvidia-smi e uma demonstração otpu-chat.
A imagem de produção executa uma unidade de matriz sistólica de quatro colunas e um mecanismo de fluxo a 133,33 MHz, com controladores de memória LiteDRAM calibrados por uma pequena CPU dentro do núcleo de memória – a placa calibra ambos os canais DDR3 em 12 segundos sem envolvimento do host. A versão atual, implantada desde 1º de outubro, decodifica vários modelos de 8 a 10 por cento mais rápido do que a imagem anterior, ao mesmo tempo em que aumenta a utilização de DRAM para 91-94 por cento do pico.
O projeto também documenta um formato de peso de 4 bits construído em valores FP4 com escalas de bloco de dois níveis a 4,25 bits por peso, mantendo o cabeçalho do modelo de linguagem em int8 para precisão. O formato reduz os bytes por token em cerca de um terço e aumenta a velocidade de decodificação em 40 a 45 por cento em alguns modelos.
O README credita a abordagem do projeto às lições de um repositório anterior, auto-arch-tournament, que explorou a pesquisa de arquitetura de hardware orientada por IA. openTPU é a aplicação desse método a um acelerador completo, com o design dos agentes validado em um simulador antes mesmo de tocar no hardware.
Por que é importante
O desempenho aqui não incomodará a Nvidia. Um Kintex-7 com DDR3 é uma classe de hardware com uma década de existência e os modelos que ele executa são pequenos. Mas esse é o ponto que o projeto enfatiza implicitamente: todo o acelerador – RTL, conjunto de instruções, simulador, compilador e pilha de host – é legível para uma pessoa, em um repositório, e foi projetado, pelo menos em parte, por agentes de IA, e não por uma equipe de hardware.
Três correntes convergem nessa ideia. Primeiro, o hardware de IA de código aberto tem sido frustrado há muito tempo pela enorme amplitude de conhecimento necessário; um fluxo de design orientado por agente reduz essa barreira. Em segundo lugar, a demanda por inferência está empurrando os pesquisadores para hardwares exóticos para fins especiais, e a pesquisa automatizada de projetos é uma opção natural para explorar esse espaço. Terceiro, o ângulo de auto-hospedagem – a IA construindo a máquina em que é executada – tornou-se um sinal que a comunidade observa de perto, a julgar pela rápida ascensão do projeto no Hacker News, onde reuniu mais de 150 pontos em poucas horas.
O repositório foi criado em 24 de setembro e recebeu seu último impulso em 2 de outubro, com resultados medidos datados de 1º de outubro – um ritmo de desenvolvimento que vale a pena observar por si só. Para quem deseja entender como um acelerador de IA funciona desde uma multiplicação de matrizes em Python até os fios, o próprio enquadramento do projeto é preciso: a coisa toda vive em um pequeno monorepo que você pode ler de ponta a ponta.
Quer o hardware projetado por agentes se torne um nicho sério ou continue a ser uma curiosidade de pesquisa, o openTPU demonstrou algo concreto: as ferramentas que permitem aos modelos de IA escrever software produziram agora um sistema de hardware verificado e funcional que executa esses mesmos modelos. O loop está fechado, pelo menos na escala FPGA.
---
Fique à Frente da IAAs últimas notícias, análises e avanços em inteligência artificial — tudo em um só lugar.
Ler mais notícias de IA →