이번 주 Hacker News에는 작지만 놀라운 프로젝트가 돌고 있습니다. openTPU는 AI 에이전트가 하드웨어 설계 자체를 제작한 오픈 소스 AI 가속기입니다. GitHub의 Apache 2.0 라이센스에 따라 게시된 저장소는 작성자가 "AI가 개발한 오픈 소스 AI 가속기"라고 부르는 것을 설명합니다. 이 장르의 대부분의 데모와는 달리 이 저장소는 열성팬이 끝까지 연구할 수 있는 물리적 카드에 실제 가중치를 적용하여 실제 생산 모델을 실행합니다.
이 프로젝트는 자체 README를 통해 두 가지 질문을 던집니다. AI 에이전트가 하드웨어 설계에서 어디까지 갈 수 있는지, 그리고 자체 추론을 실행하는 칩을 구축할 수 있는지입니다. 두 번째 질문은 도발적인 질문이다. 자체 토큰을 생성하는 실리콘(이 경우 FPGA 비트스트림)을 설계하는 AI 시스템은 업계의 상상이 향하는 방향을 정확히 포착하는 루프입니다. 이 이야기에 대한 자세한 내용은 최신 AI 동향를 참조하세요.
카드에서 실제로 실행되는 내용
하드웨어 목표는 데이터 센터 표준에 따르면 매력적이지 않습니다. 즉, 2개의 DDR3 채널과 17.1GB/s 피크 메모리 대역폭을 갖춘 Xilinx Kintex-7 xc7k480t FPGA를 중심으로 구축된 Inspur YPCB-00338 카드입니다. 이는 결과를 더욱 흥미롭게 만드는 HBM 스택 가속기와는 거리가 멀습니다.
프로젝트에서 발표된 측정값에 따르면 이 디자인은 실제 무게를 지닌 10개의 현대적인 개방형 모델을 실행합니다. LFM2.5-230M은 int8의 경우 초당 59개 토큰, 4비트의 경우 초당 85.8개 토큰으로 디코딩됩니다. Qwen3-0.6B는 초당 21.6개의 토큰을 관리하는 반면, 더 큰 모델은 예상대로 축소됩니다. SmolLM3-3B는 초당 5개 토큰 int8, Phi-4-mini(3.8B)는 4개, Qwen3.5-4B는 4비트에서 초당 5.9개 토큰입니다. Gemma 4 E2B 및 E4B도 실행되어 레이어별 임베딩 테이블을 카드에 유지합니다.
팀은 카드의 4GiB DRAM을 초과하는 전문가 혼합 모델을 개발했습니다. LFM2.5-8B-A1B — 17억 개의 활성 매개변수가 있는 85억 개의 매개변수 — 호스트 스토리지에서 전문가를 스트리밍하여 초당 10.6개의 토큰으로 디코딩합니다. 전문가의 98.5%가 카드 슬롯에 사용되며 토큰당 전송되는 양은 5.2MB에 불과합니다. Qwen3.5-35B-A3B는 초당 3.95개의 토큰으로 실행되는 동시에 PCIe를 통해 토큰당 153MB를 스트리밍합니다. README에 따르면 모든 구성은 프로젝트의 시뮬레이터 토큰과 토큰과 일치합니다. 이는 하드웨어 해커가 작업의 어려운 부분으로 인식할 비트 정확성 주장입니다.
실제 실리콘 프로젝트처럼 구축
openTPU를 일반적인 취미 FPGA 데모와 구분하는 것은 스택의 완성도입니다. 모노레포에는 SystemVerilog 하드웨어 설계, 사용자 정의 명령어 세트, 정확한 비트 시뮬레이터, 자체 컴파일러가 있는 커널 언어, nvidia-smi 정신의 otpu-smi 모니터링 유틸리티 및 otpu-chat 데모를 포함하여 PCIe 카드를 구동하는 호스트 소프트웨어가 포함되어 있습니다.
프로덕션 이미지는 메모리 코어 내부의 소형 CPU로 보정된 LiteDRAM 메모리 컨트롤러를 사용하여 4열 수축기 매트릭스 장치와 133.33MHz의 스트림 엔진을 실행합니다. 카드는 호스트 개입 없이 12초 안에 두 DDR3 채널을 모두 보정합니다. 10월 1일부터 배포된 현재 빌드는 이전 이미지보다 8~10% 더 빠르게 여러 모델을 디코딩하는 동시에 DRAM 활용도를 최대치의 91~94%까지 높입니다.
또한 이 프로젝트는 무게당 4.25비트의 2레벨 블록 스케일을 사용하여 FP4 값을 기반으로 구축된 4비트 가중치 형식을 문서화하고 정확성을 위해 언어 모델 헤드를 int8로 유지합니다. 이 형식은 토큰당 바이트를 약 1/3로 줄이고 일부 모델에서는 디코드 속도를 40~45% 높입니다.
README는 AI 기반 하드웨어 아키텍처 검색을 탐구한 이전 저장소인 자동 아치 토너먼트의 교훈에 대한 프로젝트 접근 방식을 인정합니다. openTPU는 하드웨어를 건드리기 전에 시뮬레이터에 대해 에이전트의 설계를 검증하여 완전한 가속기에 해당 방법을 적용한 것입니다.
중요한 이유
여기서의 성능은 Nvidia에 문제가 되지 않습니다. DDR3를 탑재한 Kintex-7은 10년 된 하드웨어이며, 실행되는 모델은 작습니다. 그러나 이것이 프로젝트가 암시적으로 제시하는 요점입니다. 전체 가속기(RTL, 명령어 세트, 시뮬레이터, 컴파일러 및 호스트 스택)는 하나의 저장소에서 한 사람이 읽을 수 있으며 적어도 부분적으로는 하드웨어 팀이 아닌 AI 에이전트에 의해 설계되었습니다.
그 생각에는 세 가지 흐름이 수렴됩니다. 첫째, 오픈 소스 AI 하드웨어는 필요한 광범위한 전문 지식으로 인해 오랫동안 어려움을 겪어 왔습니다. 에이전트 중심 디자인 흐름은 이러한 장벽을 낮춥니다. 둘째, 추론 수요로 인해 연구원들은 특수 목적의 하드웨어를 선호하게 되었고 자동화된 설계 검색은 해당 공간을 탐색하는 데 자연스럽게 적합합니다. 셋째, 자체 호스팅 각도(AI가 실행되는 기계를 구축함)는 커뮤니티가 면밀히 관찰하는 신호가 되었습니다. Hacker News에서 이 프로젝트가 몇 시간 만에 150포인트 이상을 모은 급속한 상승세로 판단됩니다.
저장소는 9월 24일에 생성되었으며 10월 2일에 최신 푸시를 받았으며 측정 결과는 최근 10월 1일에 기록되었습니다. 이는 그 자체로 관찰할 가치가 있는 개발 속도입니다. AI 가속기가 Python의 행렬 곱셈부터 와이어까지 어떻게 작동하는지 이해하려는 사람이라면 프로젝트 자체의 프레이밍이 정확합니다. 모든 것이 끝에서 끝까지 읽을 수 있는 하나의 작은 모노레포에 있습니다.
에이전트가 설계한 하드웨어가 심각한 틈새 시장이 되거나 연구 호기심으로 남아 있든, openTPU는 구체적인 것을 보여주었습니다. AI 모델이 소프트웨어를 작성할 수 있게 해주는 도구는 이제 동일한 모델을 실행하는 작동하고 검증된 하드웨어 시스템을 생성했습니다. 적어도 FPGA 규모에서는 루프가 닫혀 있습니다.
---
AI 최신 소식최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.
AI 뉴스 더 보기 →