이번 주 OpenAI가 GPT-6 Astra를 공개했을 때 한 데모는 개척 모델 출시에서 좀처럼 큰 소리를 내지 못했던 청중, 바로 전기 엔지니어들로부터 특별한 관심을 끌었습니다. 출시 게시물에는 오픈 소스 전자 설계 도구인 KiCad를 사용하여 회로 기판을 설계하는 모델이 등장했습니다. 그러나 소규모 엔지니어 팀은 AI 모델이 전자 소프트웨어를 작동할 수 있는지 여부가 아니라 AI 모델이 생성하는 회로가 실제로 작동하는지 여부라는 더 어려운 질문을 던지고 있습니다.

그들의 답변은 인간의 판단이 아닌 결정론적 SPICE 시뮬레이션을 사용하여 AI 설계 회로의 등급을 매기는 새로운 공개 벤치마크인 EEBench의 형태로 9월 4일에 도착했습니다. 초기 결과에 따르면 현재 모델은 출력이 일반적으로 보여주는 것보다 전자 장치에 대해 훨씬 더 많이 알고 있지만 인간 엔지니어도 당황하게 만드는 실제 부품 동작에는 여전히 실패하고 있습니다. 이 이야기에 대한 자세한 내용은 최신 AI 동향를 참조하세요.

회로 설계에 자체 벤치마크가 필요한 이유

eebench.org에 벤치마크를 게시하는 EEBench 팀은 자신의 경험에 따르면 현재 모델이 교과서, 데이터시트, 애플리케이션 노트 및 방대한 양의 코드를 흡수했음을 보여줍니다. 병목 현상은 인터페이스입니다. 에이전트가 KiCad와 같은 그래픽 CAD 도구를 작동할 때 메뉴를 클릭하고 화면에 있는 내용을 추적하는 데 많은 노력을 기울이고 전기적 추론보다는 좌표 및 애플리케이션 상태가 포함된 컨텍스트 창을 소비합니다.

EEBench는 다른 접근 방식을 취합니다. 벤치마크의 회로는 전자 장치를 선언적 코드로 설명하는 언어인 atopile로 작성되므로 에이전트는 구성 요소, 연결 및 제약 조건에 대해 직접 작업합니다. 모델은 프로젝트를 종료하지 않고도 설계를 수정하고, 구축하고, 시뮬레이션을 실행하고, 오류를 검사할 수 있습니다. 팀에 따르면 이는 모델에게 GUI에 선을 그리도록 요청하는 것보다 훨씬 더 효과적이며 벤치마크를 통해 컴퓨터 사용 기술보다는 전자 지식을 테스트할 수 있습니다.

실제 부품, 실제 실패

하나의 공공 작업은 주거용 에너지 계량기에서 가져옵니다. 5V 공급이 사라지면 회로는 프로세서의 누적된 판독값을 저장할 수 있도록 추가 20밀리초 동안 프로세서를 활성 상태로 유지해야 하며 보호 레일은 항상 프로세서의 3.0V 브라운아웃 임계값 이상을 유지해야 합니다.

팀에 따르면 대부분의 모델은 커패시터를 추가한다는 올바른 기본 결론에 즉시 도달합니다. 벤치마크는 생각보다 이를 어렵게 만듭니다. 실제 세라믹 커패시터는 전압이 인가되면 광고된 정전 용량보다 훨씬 적은 용량을 제공할 수 있으며, 부품에는 허용 오차가 있고, 추가 정전 용량으로 인해 비용이 추가되고 공간이 필요하며 전력이 돌아올 때 레일 재충전 속도가 느려집니다.

채점자들은 교과서 답변과 작업 하드웨어 사이의 격차를 보여주는 제출물을 하나 발견했습니다. 설계에서는 명목상 22 마이크로패럿을 지정했는데, 이는 종이상으로는 충분해 보이는 값입니다. 그러나 4.7V 바이어스에서 그레이더는 작업에 필요한 545μF 요구 사항보다 훨씬 낮은 11.4μF의 유효 정전 용량만 측정했습니다. 소스코드가 성공적으로 빌드되었습니다. 회로는 여전히 실패했습니다. 시뮬레이션에서는 보호 레일이 단 0.85밀리초 만에 3V 요구 사항 아래로 떨어지는 것으로 나타났습니다. 이는 요구되는 20밀리초에도 미치지 못했습니다.

어려운 작업은 더 많은 작업을 수행합니다. 하나의 아날로그 할당에는 연산 증폭기 주위에 다중 피드백 저역 통과 필터를 합성하고, 필요한 극에 대한 저항기와 커패시터 비율을 해결하고, 모든 구성 요소가 최악의 허용 오차 범위에 도달하더라도 게인, 차단 주파수 및 Q를 제한 내에서 유지해야 합니다.

채점 방식

EEBench 검사는 완전히 결정적입니다. 하네스는 제출된 설계를 작성하고, 회로 그래프와 BOM을 구성하고, SPICE 시뮬레이션 및 설계 검사 세트를 실행하며, 각 요구 사항은 수치 제한에 대한 측정을 생성합니다. 작업은 구성 요소 공차 코너에서 게인, 임계값, 리플, 과도 응답 및 동작을 측정합니다. 기술 점수는 참조 자재 명세서에 대한 비용 효율성 측정과 결합됩니다. 하지만 비용은 회로가 작동한 후에만 도움이 됩니다.

팀에서는 전압 및 구성 요소 동작을 측정하는 테스트를 제외하고 코딩 에이전트에 컴파일러 및 테스트 모음을 제공하는 것과 설정을 비교합니다. 버전 1의 모든 작업은 데이터시트에서 추출된 사양과 함께 실제 제조업체 부품을 사용하여 시뮬레이션 모델로 전달되어 에이전트가 존재하고 주문할 수 있으며 합리적인 가격이 있는 조합을 찾도록 합니다.

첫 번째 리더보드

9월 1일 결과 Claude Opus 5는 13개 작업에서 61.6%를 기록하여 EEBench V1의 최상위에 올랐습니다. Grok 4.6은 57.1%로 2위를 차지했으며, Claude Fable 5.1이 56.4%로 바로 앞섰습니다. Claude Fable 5는 54.3%, Claude Opus 4.8 Max는 51.4%를 기록했습니다. 팀은 몇 달 전에는 모델이 이렇게 잘 수행할 것이라고 기대하지 않았다고 지적합니다.

한 가지 결과는 특히 팀을 기쁘게 했습니다. xAI는 3D 모델링 및 파라메트릭 CAD 평가와 함께 엔지니어링 가속화 섹션에 Grok 4.6 모델 카드에 EEBench를 포함시켰습니다. xAI가 자체적으로 발표한 결과는 xhigh 추론 노력으로 Grok 4.6(60.0%)을 기록했습니다. xAI의 출시 자료에 따르면 이 모델은 컴퓨터 지원 설계를 포함한 도메인별 환경에서 고품질 엔지니어링 데이터와 강화 학습 교육을 받았습니다.

지금까지 테스트된 OpenAI의 모델은 GPT-5.5가 42.3%, GPT-5.6 Sol이 39.4%를 기록해 순위표보다 훨씬 아래에 있습니다. 아직 GPT-6 Astra 결과는 없습니다. 모델의 KiCad 데모가 새로운 관심을 불러일으켰다는 점을 고려하면 눈에 띄는 격차입니다. 벤치마크의 리더보드, 방법론 및 샘플 결과 탐색기는 모두 공개되어 있으며 실험실에서 자체 모델을 실행할 수 있습니다.

측정하지 않는 것 — 아직은

EEBench V1은 시뮬레이션을 통해서만 아날로그 및 디지털 설계를 다룹니다. 모델이 실제 보드를 배치하거나, ​​제조하거나, 완제품을 내놓을 수 있는지 여부는 아직 테스트하지 않았습니다. 이는 완전히 새로운 실패 모드가 나타나는 단계입니다. 팀에서는 나중에 해당 단계를 추가하고 싶지만 버전 1에서는 유용한 엔지니어링 작업을 객관적으로 평가할 수 있는 요구 사항-설계-검증 루프에 중점을 두었습니다.

그럼에도 불구하고 벤치마크는 중요한 순간에 도달했습니다. 한 선도적인 연구실에서는 이제 이를 모델 카드에 인용하고, 출시 데모에서는 전자 제품을 첫 페이지에 올렸으며, 최고 점수(61.6%)는 모델이 의미 있는 능력을 갖추면서도 신뢰성과는 거리가 멀다는 것을 보여줍니다. 이를 지켜보는 전기 엔지니어들을 위해 첫 번째 EEBench 결과의 메시지가 측정되었습니다. AI는 점점 더 종이에 회로를 설계할 수 있게 되었습니다. 실제 부품과의 접촉에서 살아남는지 여부는 바로 이 벤치마크가 알아내기 위해 존재하는 것입니다.

---

AI 최신 소식

최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.

AI 뉴스 더 보기 →