Коли цього тижня OpenAI представила GPT-6 Astra, одна демонстрація привернула особливу увагу аудиторії, яка рідко отримує відгуки під час випуску передових моделей: інженерів-електриків. Публікація презентації показала, що модель проектує друковану плату в KiCad, інструменті для проектування електроніки з відкритим кодом. Але невелика команда інженерів ставила більш складне питання — не те, чи можуть моделі штучного інтелекту керувати програмним забезпеченням електроніки, а чи справді працюють схеми, які вони виробляють.
Їхня відповідь надійшла 4 вересня у формі EEBench, нового загальнодоступного тесту, який оцінює схеми, розроблені штучним інтелектом, за допомогою детермінованого моделювання SPICE, а не людського судження. Перші результати свідчать про те, що поточні моделі знають про електроніку набагато більше, ніж зазвичай показують їхні результати, але все ще не справляються з поведінкою деталей у реальному світі, яка також бентежить інженерів-людей. For more context on this story, see our ongoing artificial intelligence updates.
Чому схемотехніці потрібен власний тест
Команда EEBench, яка публікує тест на eebench.org, каже, що її досвід показує, що поточні моделі поглинули підручники, таблиці даних, примітки до програм і величезну кількість коду. Вузьким місцем є інтерфейс. Коли агент працює з графічним інструментом САПР, таким як KiCad, він витрачає багато зусиль на клацання по меню та відстеження того, що відображається на екрані, споживаючи контекстне вікно з координатами та станом програми, а не електричні міркування.
EEBench використовує інший підхід. Схеми в тесті написані мовою atopile, яка описує електроніку як декларативний код, тому агент працює безпосередньо з компонентами, з’єднаннями та обмеженнями. Модель може змінювати проект, будувати його, запускати симуляцію та перевіряти несправності, не виходячи з проекту. За словами команди, це працює набагато краще, ніж просити модель малювати лінії в графічному інтерфейсі, і це дозволяє тесту перевірити знання електроніки, а не навички користування комп’ютером.
Реальні частини, реальні несправності
Одне громадське завдання знімається з побутового лічильника електроенергії. Коли його 5-вольтове джерело живлення зникає, схема повинна підтримувати процесор у робочому стані ще 20 мілісекунд, щоб він міг зберегти накопичені показання, при цьому захищена шина весь час залишається вище порогового значення 3,0-вольтового вимкнення процесора.
Команда повідомляє, що більшість моделей одразу приходять до правильного висновку: додають конденсатор. Тест робить це складніше, ніж здається. Справжній керамічний конденсатор може видавати набагато менше заявленої ємності, коли на нього подається напруга, деталі мають допуски, а додаткова ємність збільшує вартість, займає місце та сповільнює перезарядку шини, коли живлення повертається.
Учні впіймали один матеріал, який ілюструє розрив між відповідями підручника та робочим обладнанням. Конструкція номінально вказувала 22 мікрофаради — значення, яке виглядає достатнім на папері. Але при зміщенні 4,7 вольта грейдер виміряв лише 11,4 мікрофарад ефективної ємності, що набагато нижче вимог завдання в 545 мікрофарад. Вихідний код створено успішно. Схема все одно вийшла з ладу: симуляція показала, що захищена шина впала нижче вимоги до 3 вольт лише через 0,85 мілісекунди, навіть близько до необхідних 20.
Складніші завдання штовхають далі. Одне аналогове призначення вимагає синтезу фільтра низьких частот із множинним зворотним зв’язком навколо операційного підсилювача, визначення співвідношення резисторів і конденсаторів для необхідних полюсів і збереження посилення, частоти зрізу та добротності в межах, навіть якщо кожен компонент підштовхується до найгірших кутів допуску.
Як працює оцінка
Перевірки EEBench є повністю детермінованими. Програма розробляє поданий проект, будує електричну схему та перелік матеріалів, а також запускає набір моделювань SPICE та перевірок проекту, при цьому кожна вимога виконує вимірювання щодо числового обмеження. Завдання вимірюють посилення, порогові значення, пульсації, перехідну характеристику та поведінку в кутах допуску компонентів. Технічна оцінка поєднується з показником економічної ефективності порівняно з довідковою версією матеріалів — хоча вартість допомагає лише тоді, коли схема працює.
Команда порівнює налаштування з наданням агенту кодування компілятора та набору тестів, за винятком того, що тести вимірюють напругу та поведінку компонентів. У всіх завданнях у версії 1 використовуються деталі реального виробника, специфікації яких взято з таблиць даних і внесено в імітаційні моделі, що змушує агента знаходити комбінації, які існують, які можна замовити та мають розумну ціну.
Перша таблиця лідерів
Результати від 1 вересня поставили Claude Opus 5 на вершину EEBench V1 з 61,6% у 13 завданнях. Grok 4.6 посів друге місце з 57,1%, трохи попередивши Claude Fable 5.1 з 56,4%. Claude Fable 5 отримав 54,3%, а Claude Opus 4.8 Max – 51,4%. Команда зазначає, що кілька місяців тому вони не очікували, що моделі будуть працювати так добре.
Один результат особливо порадував команду: xAI включив EEBench до картки моделі Grok 4.6 у розділі про інженерне прискорення разом із 3D-моделюванням і параметричними оцінками CAD. Власний опублікований цикл xAI отримав оцінку Grok 4,6 при 60,0% із xвисокими зусиллями аргументації. Згідно з матеріалами запуску xAI, модель отримала високоякісні інженерні дані та навчання підкріпленню в предметно-спеціальних середовищах, включаючи автоматизоване проектування.
Моделі OpenAI, протестовані на даний момент, йдуть далі в таблиці: GPT-5.5 набрав 42,3%, а GPT-5.6 Sol – 39,4%. Результатів GPT-6 Astra ще немає — помітна прогалина, враховуючи, що демонстрація моделі KiCad знову привернула увагу. Таблиця лідерів, методологія та дослідник результатів тестування є загальнодоступними, і лабораторії можуть запускати власні моделі.
Те, що він ще не вимірює
EEBench V1 охоплює аналогове та цифрове проектування лише за допомогою моделювання. Він ще не перевіряє, чи може модель скласти фізичну плату, виготовити її чи створити готовий продукт — етапи, на яких з’являються абсолютно нові режими відмови. Команда каже, що хоче додати ці етапи пізніше, але зосередилася на версії 1 на циклі «вимоги-дизайн-перевірка», оскільки саме там вже можна об’єктивно оцінити корисну інженерну роботу.
Тим не менш, тест приземляється в показовий момент. Передова лабораторія тепер цитує його в картці моделей, демонстраційні випуски виводять електроніку на першу сторінку, а найвищий результат — 61,6% — показує, що моделі стають суттєво спроможними, залишаючись далеко не надійними. Для інженерів-електриків спостерігають повідомлення перших результатів EEBench: штучний інтелект може все частіше проектувати схеми на папері. Чи виживають вони при контакті з реальними частинами, саме те, що існує для цього тесту.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →