Когда на этой неделе OpenAI представила GPT-6 Astra, одна демонстрация привлекла особое внимание аудитории, которая редко получает одобрение при запуске передовых моделей: инженеров-электриков. На стартовом посте была представлена ​​модель, проектирующая печатную плату в KiCad, инструменте проектирования электроники с открытым исходным кодом. Но небольшая группа инженеров задалась более сложным вопросом: не могут ли модели искусственного интеллекта работать с электронным программным обеспечением, а работают ли на самом деле схемы, которые они производят.

Их ответ пришел 4 сентября в виде EEBench, нового общедоступного теста, который оценивает схемы, разработанные с помощью искусственного интеллекта, с использованием детерминистического моделирования SPICE, а не человеческого суждения. Первые результаты показывают, что нынешние модели знают об электронике гораздо больше, чем обычно показывают их результаты, но все же не справляются с тем поведением деталей в реальном мире, которое сбивает с толку и инженеров-людей. Подробнее об этой истории — в нашем больше статей об ИИ.

Почему схемотехнике нужен собственный эталон

Команда EEBench, которая публикует тесты на сайте eebench.org, говорит, что ее опыт показывает, что текущие модели включают в себя учебники, таблицы данных, рекомендации по применению и огромное количество кода. Узким местом является интерфейс. Когда агент использует графический инструмент САПР, такой как KiCad, он тратит большую часть своих усилий, просматривая меню и отслеживая то, что отображается на экране, используя свое контекстное окно с координатами и состоянием приложения, а не с электрическими рассуждениями.

EEBench использует другой подход. Схемы в тесте написаны на атопиле — языке, который описывает электронику как декларативный код, поэтому агент работает непосредственно с компонентами, соединениями и ограничениями. Модель может изменять проект, строить его, запускать моделирование и проверять неисправности, не выходя из проекта. По мнению команды, это работает гораздо лучше, чем просить модель рисовать линии в графическом интерфейсе, и позволяет тестировать знания в области электроники, а не навыки использования компьютера.

Реальные детали, реальные неисправности

Одна общественная задача взята из бытового счетчика энергии. Когда питание 5 В пропадает, схема должна поддерживать процессор в рабочем состоянии еще 20 миллисекунд, чтобы он мог сохранить накопленные показания, при этом защищенная шина все время остается выше порога отключения процессора в 3,0 В.

По данным команды, большинство моделей сразу приходят к правильному базовому выводу: добавить конденсатор. Тест делает это сложнее, чем кажется. Настоящий керамический конденсатор может выдавать гораздо меньшую заявленную емкость, когда на него подается напряжение, детали имеют допуски, а дополнительная емкость увеличивает стоимость, занимает место и замедляет перезарядку шины при восстановлении питания.

Оценщики поймали одно задание, которое иллюстрирует разрыв между ответами из учебника и работающим оборудованием. В конструкции номинально указано 22 микрофарада — значение, которое на бумаге выглядит достаточным. Но при напряжении смещения 4,7 В грейдер измерил только 11,4 мкФ эффективной емкости, что намного ниже требуемых для задачи 545 мкФ. Исходный код успешно создан. Схема все равно вышла из строя: моделирование показало, что напряжение на защищенной шине упало ниже требуемого напряжения в 3 В всего за 0,85 миллисекунды, что далеко от требуемых 20.

Более сложные задачи продвигают дальше. Одно аналоговое назначение требует синтеза фильтра нижних частот с множественной обратной связью вокруг операционного усилителя, определения коэффициентов сопротивления резисторов и конденсаторов для требуемых полюсов и поддержания коэффициента усиления, частоты среза и добротности в определенных пределах, даже когда каждый компонент доведен до пределов допуска наихудшего случая.

Как работает оценка

Проверки EEBench полностью детерминированы. Программное обеспечение строит представленный проект, строит схему и спецификацию материалов, а также запускает набор SPICE-симуляций и проверок проекта, при этом каждое требование производит измерение в соответствии с числовым пределом. Задачи измеряют усиление, пороговые значения, пульсации, переходные процессы и поведение в углах допуска компонентов. Техническая оценка сочетается с показателем экономической эффективности по сравнению с эталонной спецификацией материалов, хотя стоимость помогает только тогда, когда схема работает.

Команда сравнивает эту настройку с предоставлением агенту кодирования компилятора и набора тестов, за исключением того, что тесты измеряют напряжение и поведение компонентов. Во всех задачах версии 1 используются детали реальных производителей со спецификациями, извлеченными из таблиц данных и перенесенными в имитационные модели, что заставляет агента находить комбинации, которые существуют, которые можно заказать и которые продаются по разумной цене.

Первая таблица лидеров

По результатам 1 сентября Claude Opus 5 возглавил EEBench V1 с результатом 61,6% по 13 задачам. Grok 4.6 занял второе место с 57,1%, опередив Claude Fable 5.1 с 56,4%. Claude Fable 5 набрал 54,3%, а Claude Opus 4,8 Max 51,4%. Команда отмечает, что несколько месяцев назад она не ожидала, что модели будут работать так хорошо.

Один результат особенно порадовал команду: xAI включила EEBench в карточку модели Grok 4.6, в раздел, посвященный ускорению проектирования наряду с 3D-моделированием и параметрическими оценками CAD. Собственный опубликованный тест xAI получил оценку Grok 4,6 при 60,0% при высоком уровне аргументации. Согласно стартовым материалам xAI, модель получила высококачественные инженерные данные и прошла обучение с подкреплением в предметных средах, включая автоматизированное проектирование.

Модели OpenAI, протестированные на данный момент, находятся ниже в таблице: GPT-5.5 набрал 42,3%, а GPT-5.6 Sol — 39,4%. Результата GPT-6 Astra пока нет — заметный разрыв, учитывая, что демо-версия модели KiCad вызвала новое внимание. Таблица лидеров, методология и образец результатов теста являются общедоступными, и лаборатории могут запускать свои собственные модели.

То, что он не измеряет — пока

EEBench V1 охватывает аналоговое и цифровое проектирование только посредством моделирования. Он еще не проверяет, может ли модель собрать физическую плату, изготовить ее или создать готовый продукт — этапы, на которых появляются совершенно новые виды отказов. Команда заявляет, что хочет добавить эти этапы позже, но в версии 1 основное внимание уделялось циклу требований-проектирования-проверки, поскольку именно здесь уже можно объективно оценить полезную инженерную работу.

Тем не менее, эталонная оценка приходится на решающий момент. Пограничная лаборатория теперь упоминает это в карточке модели, демонстрационные версии запуска помещают электронику на первую страницу, а высший балл — 61,6% — показывает, что модели становятся значимыми, но при этом остаются далекими от надежности. Для инженеров-электриков смысл первых результатов EEBench понятен: ИИ может все чаще проектировать схемы на бумаге. Выживут ли они при контакте с реальными деталями, именно для этого и существует этот тест.

---

Будьте в курсе ИИ

Последние новости, аналитика и прорывы в сфере ИИ — всё в одном месте.

Читать больше новостей об ИИ →