OpenAI が今週 GPT-6 Astra を発表したとき、あるデモはフロンティア モデルの発売ではめったに歓声を上げることのない聴衆、つまり電気エンジニアから特に注目を集めました。ローンチポストでは、オープンソースのエレクトロニクス設計ツールである KiCad で回路基板を設計するモデルを特集しました。しかし、エンジニアの小さなチームは、AI モデルがエレクトロニクス ソフトウェアを操作できるかどうかではなく、AI モデルが作成する回路が実際に機能するかどうかという、より難しい質問を行っています。
彼らの答えは、人間の判断ではなく決定論的な SPICE シミュレーションを使用して AI 設計の回路を評価する新しい公開ベンチマークである EEBench の形で 9 月 4 日に到着しました。初期の結果は、現在のモデルがその出力が通常示すよりも電子機器についてはるかに多くのことを知っているにもかかわらず、人間のエンジニアをもつまずかせるような現実世界の部品の動作では依然として失敗していることを示唆しています。 この件の詳細は、AIニュースをご覧ください。
回路設計に独自のベンチマークが必要な理由
eebench.org でベンチマークを公開している EEBench チームは、その経験から現在のモデルが教科書、データシート、アプリケーション ノート、および膨大な量のコードを吸収していることが示されていると述べています。ボトルネックはインターフェイスです。エージェントが KiCad などのグラフィカル CAD ツールを操作する場合、メニューをクリックして画面上の内容を追跡することに多くの労力を費やし、電気的な推論ではなく、座標とアプリケーションの状態を示すコンテキスト ウィンドウを消費します。
EEBench は異なるアプローチを採用しています。ベンチマークの回路は、電子機器を宣言型コードとして記述する言語である atopile で記述されているため、エージェントはコンポーネント、接続、制約に直接作用します。モデルは、プロジェクトを離れることなく、設計の変更、構築、シミュレーションの実行、および障害の検査を行うことができます。チームによると、これはモデルに GUI で線を描画させるよりもはるかに効果的であり、ベンチマーク テストではコンピューターの使用スキルではなく電子機器の知識をテストできます。
実際の部品、実際の故障
1 つの公共タスクは住宅用エネルギー メーターから取得されます。 5 ボルトの供給がなくなると、回路はプロセッサをさらに 20 ミリ秒間維持し、蓄積された読み取り値を保存し、保護されたレールがプロセッサの 3.0 ボルトの電圧低下しきい値を常に超えた状態に保つ必要があります。
研究チームの報告によると、ほとんどのモデルはコンデンサを追加するという正しい基本的な結論にすぐに達します。ベンチマークはそれを思っているよりも難しくしています。実際のセラミックコンデンサは、電圧が印加されると宣伝されている静電容量よりもはるかに小さくなる可能性があり、部品には公差があり、余分な静電容量によってコストが追加され、スペースが必要になり、電力が戻ったときにレールの再充電が遅くなります。
採点者は、教科書の解答と実際に動作するハードウェアとの間のギャップを示す 1 つの提出物を見つけました。設計では公称 22 マイクロファラッドが指定されており、紙の上では十分に見える値です。しかし、バイアスが 4.7 ボルトの場合、グレーダーは実効静電容量を 11.4 マイクロファラッドしか測定せず、タスクの要件である 545 マイクロファラッドをはるかに下回っていました。ソースコードは正常にビルドされました。回路は依然として故障しました。シミュレーションでは、保護されたレールがわずか 0.85 ミリ秒後に要件 3 ボルトを下回り、要件の 20 ボルトには遠く及ばないことが示されました。
より困難なタスクはさらに前進します。アナログ割り当ての 1 つは、オペアンプの周りに多重フィードバック ローパス フィルターを合成し、必要な極の抵抗とコンデンサの比を解決し、すべてのコンポーネントが最悪の許容誤差のコーナーに追い込まれた場合でも、ゲイン、カットオフ周波数、および Q を制限内に維持する必要があります。
グレーディングの仕組み
EEBench チェックは完全に決定的です。ハーネスは、提出された設計を構築し、回路グラフと部品表を構築し、一連の SPICE シミュレーションと設計チェックを実行して、各要件の数値制限に対する測定を行います。タスクでは、ゲイン、しきい値、リップル、過渡応答、およびコンポーネント公差のコーナーでの動作を測定します。技術スコアは、参考部品表に対するコスト効率の指標と組み合わされますが、コストは回路が機能して初めて役立ちます。
チームは、このセットアップを、電圧とコンポーネントの動作を測定するテストを除いて、コーディング エージェントにコンパイラとテスト スイートを与えることと比較しています。バージョン 1 のすべてのタスクは、実際のメーカーの部品を使用しており、仕様はデータシートから抽出されてシミュレーション モデルに組み込まれているため、エージェントは、存在し、注文でき、手頃な価格の組み合わせを見つける必要があります。
最初のリーダーボード
9 月 1 日の結果では、Claude Opus 5 が 13 タスク全体で 61.6% を獲得し、EEBench V1 のトップになりました。 Grok 4.6 は 57.1% で 2 位となり、Claude Fable 5.1 の 56.4% をわずかに上回りました。クロード・ファブル5のスコアは54.3%、クロード・オーパス4.8マックスのスコアは51.4%でした。研究チームは、数カ月前にはモデルがこれほど優れたパフォーマンスを発揮するとは予想していなかった、と指摘している。
チームが特に満足した結果の 1 つは、xAI が Grok 4.6 モデル カードに、3D モデリングやパラメトリック CAD 評価と並んでエンジニアリング アクセラレーションに関するセクションに EEBench を組み込んだことです。 xAI 自身が公開した実行結果は、xhigh 推論努力により 60.0% で Grok 4.6 というスコアを獲得しました。 xAI の発表資料によると、このモデルは高品質のエンジニアリング データと、コンピューター支援設計を含むドメイン固有の環境での強化学習トレーニングを受けています。
これまでにテストされた OpenAI のモデルはさらに下位にあり、GPT-5.5 のスコアは 42.3%、GPT-5.6 Sol のスコアは 39.4% でした。 GPT-6 Astra の結果はまだありません。モデルの KiCad デモが新たな注目を集めたことを考えると、注目に値するギャップです。ベンチマークのリーダーボード、方法論、サンプル結果エクスプローラーはすべて公開されており、ラボは独自のモデルを実行できます。
測定できないもの — まだ
EEBench V1 は、シミュレーションを通じてのみアナログおよびデジタル設計をカバーします。モデルが物理的な基板をレイアウトできるか、製造できるか、完成品を生み出すことができるかどうかはまだテストされておらず、まったく新しい故障モードが現れる段階です。チームは、これらの段階を後で追加したいと述べているが、バージョン 1 では、有用なエンジニアリング作業をすでに客観的に評価できるため、要件 - 設計 - 検証ループに焦点を当てた。
それでも、ベンチマークは決定的な瞬間に到達します。フロンティアラボは現在、モデルカードでそれを引用しており、発売デモではエレクトロニクスをトップページに掲載しており、最高スコア (61.6%) は、モデルが信頼性からはほど遠いものの、有意義な機能を獲得していることを示しています。見ている電気技術者にとって、最初の EEBench の結果から得られるメッセージは、AI が紙の上でますます回路を設計できるようになっているということです。実際の部品との接触に耐えられるかどうかを調べるためにこのベンチマークが存在します。
---
AIの最新情報をお届けAIの最新ニュース、分析、ブレイクスルーを一箇所で。
AIニュースをもっと読む →