Když OpenAI tento týden představilo GPT-6 Astra, jedno demo přitáhlo zvláštní pozornost publika, které se při uvedení hraničních modelů jen zřídkakdy ozve: elektroinženýři. Startovní místo představovalo model navrhující obvodovou desku v KiCad, open-source nástroji pro návrh elektroniky. Malý tým inženýrů si však klade těžší otázku – ne zda modely AI dokážou ovládat elektronický software, ale zda obvody, které vyrábějí, skutečně fungují.
Jejich odpověď dorazila 4. září ve formě EEBench, nového veřejného benchmarku, který hodnotí obvody navržené AI pomocí deterministických simulací SPICE spíše než lidského úsudku. První výsledky naznačují, že současné modely vědí o elektronice mnohem více, než jejich výstup obvykle ukazuje, ale stále selhávají v takovém chování součástí v reálném světě, které podrazí i lidské inženýry. For more context on this story, see our ongoing artificial intelligence updates.
Proč obvodový design potřeboval svůj vlastní benchmark
Tým EEBench, který benchmark publikuje na eebench.org, říká, že jeho zkušenosti ukazují, že současné modely absorbovaly učebnice, datové listy, poznámky k aplikacím a obrovské množství kódu. Úzkým místem je rozhraní. Když agent provozuje grafický nástroj CAD, jako je KiCad, vynakládá velkou část svého úsilí na procházení nabídek a sledování toho, co je na obrazovce, přičemž využívá kontextové okno se souřadnicemi a stavem aplikace spíše než elektrickým uvažováním.
EEBench má jiný přístup. Obvody v benchmarku jsou napsány v atopile, což je jazyk, který popisuje elektroniku jako deklarativní kód, takže agent pracuje přímo na součástech, připojeních a omezeních. Model může upravit návrh, vytvořit jej, spustit simulaci a zkontrolovat selhání, aniž by opustil projekt. Podle týmu to funguje mnohem lépe než žádat model, aby nakreslil čáry v grafickém uživatelském rozhraní – a umožňuje to benchmarku testovat znalosti elektroniky spíše než dovednosti v používání počítače.
Skutečné díly, skutečná selhání
Jeden veřejný úkol je čerpán z bytového elektroměru. Když jeho 5voltové napájení zmizí, obvod musí udržet procesor při životě dalších 20 milisekund, aby mohl uložit nashromážděné údaje, přičemž chráněná kolejnice zůstane po celou dobu nad prahovou hodnotou 3,0 voltu procesoru.
Většina modelů, hlásí tým, okamžitě dosáhne správného základního závěru: přidat kondenzátor. Benchmark to dělá těžší, než se zdá. Skutečný keramický kondenzátor může dodávat mnohem menší kapacitu, než je jeho inzerovaná kapacita, jakmile je na něj aplikováno napětí, části nesou tolerance a další kapacita zvyšuje náklady, zabírá místo a zpomaluje dobíjení kolejnice, když se obnoví napájení.
Srovnávači zachytili jeden příspěvek, který ilustruje propast mezi odpověďmi z učebnice a funkčním hardwarem. Návrh specifikoval nominálně 22 mikrofaradů – hodnota, která na papíře vypadá dostatečně. Ale při předpětí 4,7 voltů naměřil srovnávač pouze 11,4 mikrofaradů efektivní kapacity, což je mnohem méně, než je požadavek na 545 mikrofaradů. Zdrojový kód byl úspěšně vytvořen. Okruh stále selhal: simulace ukázala, že chráněná kolejnice klesla pod požadavek 3 voltů po pouhých 0,85 milisekundách, což se ani zdaleka neblíží požadovaným 20.
Těžší úkoly posouvají dál. Jedno analogové přiřazení vyžaduje syntetizovat vícenásobnou zpětnou vazbu dolní propusti kolem operačního zesilovače, vyřešit poměry rezistorů a kondenzátorů pro požadované póly a udržet zisk, mezní frekvenci a Q v mezích, i když je každá součástka zatlačena do krajů tolerance nejhoršího případu.
Jak funguje klasifikace
EEBench kontroly jsou plně deterministické. Kabelový svazek vytvoří předložený návrh, zkonstruuje obvodový graf a kusovník a spustí sadu simulací a návrhů SPICE, přičemž každý požadavek vytvoří měření proti číselnému limitu. Úlohy měří zisk, prahové hodnoty, zvlnění, přechodnou odezvu a chování v rozích tolerance komponent. Technické skóre je kombinováno s mírou nákladové efektivity oproti referenčnímu kusovníku – i když náklady pomáhají pouze tehdy, když obvod funguje.
Tým porovnává nastavení s tím, že kódovacímu agentovi poskytne kompilátor a testovací sadu, kromě toho, že testy měří napětí a chování komponent. Všechny úlohy ve verzi 1 používají díly skutečného výrobce se specifikacemi extrahovanými z datových listů a přenesenými do simulačních modelů, což nutí agenta najít kombinace, které existují, lze je objednat a jsou za rozumnou cenu.
První žebříček
Výsledky z 1. září umístily Claude Opus 5 na vrchol EEBench V1 s 61,6 % ve 13 úkolech. Grok 4.6 se umístil na druhém místě s 57,1 %, těsně před Claudem Fablem 5.1 s 56,4 %. Claude Fable 5 dosáhl skóre 54,3 % a Claude Opus 4,8 Max 51,4 %. Tým poznamenává, že před několika měsíci by neočekával, že modely budou fungovat tak dobře.
Jeden výsledek potěšil zejména tým: xAI zahrnulo EEBench do modelové karty Grok 4.6 v sekci o technické akceleraci spolu s 3D modelováním a parametrickými CAD vyhodnoceními. Vlastní publikovaný běh xAI získal Grok 4,6 na 60,0 % s xvysokým úsilím o uvažování. Podle spouštěcích materiálů xAI model obdržel vysoce kvalitní inženýrská data a školení o výuce v prostředí specifických pro doménu, včetně počítačově podporovaného návrhu.
Dosud testované modely OpenAI sedí dále v tabulce: GPT-5.5 dosáhl skóre 42,3 % a GPT-5.6 Sol 39,4 %. Zatím neexistuje žádný výsledek GPT-6 Astra – pozoruhodná mezera vzhledem k tomu, že ukázka modelu KiCad vyvolala obnovenou pozornost. Žebříček, metodika a průzkumník výsledků srovnávacího testu jsou veřejné a laboratoře mohou provozovat své vlastní modely.
Co neměří — zatím
EEBench V1 pokrývá analogový a digitální návrh pouze prostřednictvím simulace. Zatím netestuje, zda model dokáže rozmístit fyzickou desku, vyrobit ji nebo vytvořit hotový produkt – fáze, kde se objevují zcela nové způsoby selhání. Tým říká, že chce tyto fáze přidat později, ale zaměřil se ve verzi 1 na smyčku požadavků-návrh-ověření, protože tam už může být užitečná inženýrská práce objektivně hodnocena.
Přesto benchmark přistane v rozhodujícím okamžiku. Hraniční laboratoř to nyní uvádí na kartě modelu, ukázky uvedení elektroniku na titulní stránku a nejvyšší skóre – 61,6 % – ukazuje, že modely získávají smysluplné schopnosti a přitom zůstávají daleko od spolehlivosti. Pro přihlížející elektrotechniky je zpráva z prvních výsledků EEBench měřena: AI může stále více navrhovat obvody na papíře. Zda přežijí kontakt se skutečnými součástmi, je přesně to, co tento benchmark existuje ke zjištění.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →