На этой неделе в Hacker News распространяется небольшой, но поразительный проект: openTPU, ускоритель искусственного интеллекта с открытым исходным кодом, аппаратный дизайн которого сам был разработан агентами искусственного интеллекта. Репозиторий, опубликованный под лицензией Apache 2.0 на GitHub, описывает то, что его авторы называют «ускорителем ИИ с открытым исходным кодом, разработанным ИИ» — и в отличие от большинства демонстраций в этом жанре, он запускает реальные производственные модели с их реальным весом на физической карте, которую энтузиасты могут изучить от начала до конца.
Проект задает два вопроса, как сказано в его собственном README: как далеко агенты ИИ могут зайти в проектировании аппаратного обеспечения и могут ли они создать чип, который выполняет собственный вывод? Второй вопрос – провокационный. Система искусственного интеллекта, разрабатывающая микросхему (или, в данном случае, битовый поток FPGA), которая генерирует свои собственные токены, представляет собой цикл, который точно фиксирует, куда движется воображение отрасли. Подробнее об этой истории — в нашем больше статей об ИИ.
Что на самом деле работает на карте
Аппаратная цель непривлекательна по стандартам центров обработки данных: карта Inspur YPCB-00338, построенная на базе FPGA Xilinx Kintex-7 xc7k480t с двумя каналами DDR3 и пиковой пропускной способностью памяти 17,1 ГБ/с. Это далеко от ускорителя на базе HBM, что делает результаты более интересными, а не менее.
Согласно опубликованным измерениям проекта, в конструкции используются десять современных открытых моделей с их реальным весом. LFM2.5-230M декодирует со скоростью 59 токенов в секунду в формате int8 и 85,8 токенов в секунду в 4-битном формате. Qwen3-0.6B обрабатывает 21,6 токенов в секунду, в то время как более крупные модели масштабируются, как и ожидалось: SmolLM3-3B со скоростью 5 токенов в секунду int8, Phi-4-mini (3,8B) с 4 и Qwen3.5-4B со скоростью 5,9 токенов в секунду в 4-битном режиме. Gemma 4 E2B и E4B также работают, сохраняя свои послойные таблицы внедрения постоянно на карте.
Команда пошла дальше, выпустив смешанные экспертные модели, объем DRAM карты которых превышает 4 ГиБ. LFM2.5-8B-A1B — 8,5 миллиардов параметров и 1,7 миллиарда активных — декодирует со скоростью 10,6 токенов в секунду путем потоковой передачи экспертов из хранилища хоста, при этом 98,5 процентов экспертов используют слоты на картах и передается только 5,2 МБ на каждый токен. Qwen3.5-35B-A3B работает со скоростью 3,95 токенов в секунду при потоковой передаче 153 МБ на токен через PCIe. Каждая конфигурация, как указано в README, соответствует токену симулятора проекта — утверждение побитовой точности, которое аппаратные хакеры сочтут самой сложной частью работы.
Построен как настоящий кремниевый проект
Что отличает openTPU от типичных любительских демонстраций FPGA, так это полнота стека. Монорепозиторий содержит аппаратную конструкцию SystemVerilog, собственный набор инструкций, точный побитовый симулятор, язык ядра с собственным компилятором и хост-программу, которая управляет картой PCIe, включая утилиту мониторинга otpu-smi в духе nvidia-smi и демо-версию otpu-chat.
В производственном образе используется систолический матричный блок с четырьмя столбцами и потоковый движок на частоте 133,33 МГц, а контроллеры памяти LiteDRAM калибруются небольшим ЦП внутри ядра памяти — карта калибрует оба канала DDR3 за 12 секунд без участия хоста. Текущая сборка, развернутая с 1 октября, декодирует несколько моделей на 8–10 процентов быстрее, чем предыдущая версия, одновременно увеличивая использование DRAM до 91–94 процентов от пиковой нагрузки.
В проекте также документирован 4-битный весовой формат, основанный на значениях FP4 с двухуровневой блочной шкалой по 4,25 бита на вес, сохраняя для точности заголовок языковой модели в формате int8. Этот формат сокращает количество байтов на токен примерно на треть и увеличивает скорость декодирования на 40–45 процентов на некоторых моделях.
В README подход проекта основан на уроках из более раннего репозитория auto-arch-tournament, в котором исследовался поиск аппаратной архитектуры на основе искусственного интеллекта. openTPU — это применение этого метода к полноценному ускорителю, при этом конструкция агентов проверяется на симуляторе еще до того, как они коснутся аппаратного обеспечения.
Почему это важно
Производительность здесь не побеспокоит Nvidia. Kintex-7 с DDR3 — это аппаратный класс десятилетней давности, и модели, на которых он работает, небольшие. Но это то, что проект неявно подчеркивает: весь ускоритель — RTL, набор команд, симулятор, компилятор и стек хоста — доступен для чтения одному человеку в одном репозитории, и он был разработан, по крайней мере частично, агентами ИИ, а не командой разработчиков оборудования.
В этой идее сходятся три течения. Во-первых, аппаратное обеспечение искусственного интеллекта с открытым исходным кодом уже давно находится в тупике из-за огромного объема необходимых знаний; поток проектирования, управляемый агентом, снижает этот барьер. Во-вторых, спрос на логические выводы подталкивает исследователей к экзотическому оборудованию специального назначения, и автоматизированный поиск проектов является естественным подспорьем для исследования этой области. В-третьих, идея самостоятельного хостинга — ИИ создает машину, на которой он работает — стала сигналом, за которым внимательно следит сообщество, судя по быстрому росту проекта на Hacker News, где за несколько часов он набрал более 150 баллов.
Репозиторий был создан 24 сентября и получил последний импульс 2 октября, а измеренные результаты датированы совсем недавно, 1 октября — темпы разработки сами по себе заслуживают внимания. Для тех, кто хочет понять, как работает ускоритель ИИ, начиная с умножения матриц в Python и заканчивая проводами, структура проекта точна: все это находится в одном небольшом монорепозитории, который вы можете прочитать от начала до конца.
Независимо от того, станет ли аппаратное обеспечение, разработанное агентами, серьезной нишей или останется предметом исследовательской диковины, openTPU продемонстрировал кое-что конкретное: инструменты, которые позволяют моделям ИИ писать программное обеспечение, теперь создали работающую, проверенную аппаратную систему, на которой работают те же самые модели. Цикл замкнут, по крайней мере, в масштабе FPGA.
---
Будьте в курсе ИИПоследние новости, аналитика и прорывы в сфере ИИ — всё в одном месте.
Читать больше новостей об ИИ →