Цього тижня на Hacker News поширюється невеликий, але вражаючий проект: openTPU, прискорювач штучного інтелекту з відкритим вихідним кодом, апаратне забезпечення якого було розроблено агентами штучного інтелекту. Репозиторій, опублікований за ліцензією Apache 2.0 на GitHub, описує те, що його автори називають «прискорювачем ШІ з відкритим кодом, розробленим ШІ» — і, на відміну від більшості демонстрацій цього жанру, він запускає реальні виробничі моделі з їхньою реальною вагою на фізичній картці, яку ентузіасти можуть вивчати від кінця до кінця.

Проект ставить два запитання, кажучи словами його власного README: як далеко агенти штучного інтелекту можуть зайти в розробці апаратного забезпечення та чи зможуть вони створити чіп, який керуватиме їхніми власними висновками? Друге питання – провокаційне. Система штучного інтелекту, що розробляє кремній — або, в даному випадку, бітовий потік FPGA, — який генерує власні маркери, — це цикл, який точно відображає, куди прямує уява галузі. For more context on this story, see our ongoing more AI stories.

Що насправді працює на картці

За стандартами центрів обробки даних цільове апаратне забезпечення непривабливе: карта Inspur YPCB-00338, побудована на основі Xilinx Kintex-7 xc7k480t FPGA з двома каналами DDR3 і піковою пропускною здатністю пам’яті 17,1 ГБ/с. Це дуже далеко від прискорювача HBM-stack, що робить результати цікавішими, а не меншими.

Згідно з опублікованими вимірюваннями проекту, конструкція запускає десять сучасних відкритих моделей з їх реальною вагою. LFM2.5-230M декодує зі швидкістю 59 токенів на секунду в int8 і 85,8 токенів на секунду в 4-бітному. Qwen3-0.6B керує 21,6 токенами на секунду, тоді як більші моделі зменшуються, як і очікувалося: SmolLM3-3B з 5 токенами на секунду int8, Phi-4-mini (3.8B) з 4 і Qwen3.5-4B з 5,9 токенами на секунду в 4-розрядному режимі. Gemma 4 E2B і E4B також працюють, зберігаючи таблиці вбудовування кожного рівня на картці.

Команда пішла далі, створивши суміші експертних моделей, які перевищують 4 ГБ DRAM цієї карти. LFM2.5-8B-A1B — 8,5 мільярда параметрів із 1,7 мільярда активних — декодує зі швидкістю 10,6 маркерів на секунду шляхом потокової передачі експертів із хост-сховища, при цьому 98,5 відсотків використання експертів потрапляє на слоти на карті та лише 5,2 МБ передано на маркер. Qwen3.5-35B-A3B працює зі швидкістю 3,95 токенів на секунду, передає 153 МБ на токен через PCIe. Кожна конфігурація, зазначається в README, відповідає маркеру симулятора проекту — твердження про бітову точність, яке апаратні хакери визнають складною частиною роботи.

Створено як справжній силіконовий проект

Що відрізняє openTPU від типових демонстрацій FPGA для хобі, так це повнота стеку. Monorepo містить апаратну конструкцію SystemVerilog, спеціальний набір інструкцій, симулятор з бітовою точністю, мову ядра з власним компілятором і програмне забезпечення хоста, яке керує картою PCIe, включаючи утиліту моніторингу otpu-smi в дусі nvidia-smi та демонстрацію otpu-chat.

У робочому образі працює блок систолічної матриці з чотирма стовпцями та механізм потоку на частоті 133,33 МГц із контролерами пам’яті LiteDRAM, відкаліброваними невеликим ЦП у ядрі пам’яті — карта калібрує обидва канали DDR3 за 12 секунд без участі хоста. Поточна збірка, розгорнута з 1 жовтня, декодує кілька моделей на 8-10 відсотків швидше, ніж попереднє зображення, підвищуючи використання DRAM до 91-94 відсотків від пікового значення.

Проект також документує 4-бітний формат ваги, побудований на значеннях FP4 із дворівневими шкалами блоків із 4,25 біта на вагу, зберігаючи заголовок мовної моделі в int8 для точності. Формат скорочує кількість байтів на маркер приблизно на третину та підвищує швидкість декодування на 40–45 відсотків на деяких моделях.

README відзначає підхід проекту до уроків із попереднього репозиторію, турніру з автоматичними архівами, який досліджував пошук апаратної архітектури, керованої ШІ. openTPU — це застосування цього методу до повного прискорювача з перевіркою дизайну агентів на симуляторі перед тим, як торкнутися обладнання.

Чому це важливо

Продуктивність тут не завадить Nvidia. Kintex-7 із DDR3 — це апаратне забезпечення десятирічної давності, і моделі, на яких він працює, невеликі. Але це те, про що проект неявно говорить: весь прискорювач — RTL, набір інструкцій, симулятор, компілятор і хост-стек — доступний для читання одній людині в одному репозиторії, і він був розроблений принаймні частково агентами штучного інтелекту, а не апаратною командою.

У цій ідеї сходяться три течії. По-перше, апаратне забезпечення штучного інтелекту з відкритим вихідним кодом довгий час перешкоджало величезній кількості необхідних знань; керований агентом потік проектування знижує цей бар’єр. По-друге, попит на висновки штовхає дослідників до екзотичного обладнання спеціального призначення, і автоматизований пошук дизайну є природним підходом для дослідження цього простору. По-третє, кут самостійного розміщення — ШІ створює машину, на якій він працює — став сигналом, за яким спільнота уважно стежить, судячи зі стрімкого зростання проекту на Hacker News, де він зібрав понад 150 балів за кілька годин.

Репозиторій було створено 24 вересня та отримав останній поштовх 2 жовтня, а виміряні результати датовані аж 1 жовтня — темп розвитку сам по собі вартий уваги. Для всіх, хто хоче зрозуміти, як працює прискорювач штучного інтелекту від множення матриць у Python до дротів, власне фреймування проекту є точним: усе це живе в одному маленькому монорепо, яке можна прочитати до кінця.

Незалежно від того, чи апаратне забезпечення, розроблене агентами, стане серйозною нішею чи залишиться дослідницькою цікавістю, openTPU продемонстрував щось конкретне: інструменти, які дозволяють моделям штучного інтелекту писати програмне забезпечення, тепер створили робочу, перевірену апаратну систему, яка запускає ті самі моделі. Цикл замкнутий, принаймні в масштабі FPGA.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →