OpenAI bu hafta GPT-6 Astra'yı tanıttığında, bir demo, öncü model lansmanlarında nadiren seslenen bir kitlenin, yani elektrik mühendislerinin özellikle ilgisini çekti. Lansman yazısında, açık kaynaklı elektronik tasarım aracı KiCad'de devre kartı tasarlayan model yer alıyordu. Ancak küçük bir mühendis ekibi daha zor bir soruyu soruyor: Yapay zeka modellerinin elektronik yazılımları çalıştırıp çalıştıramayacağı değil, ürettikleri devrelerin gerçekten çalışıp çalışmadığı.

Cevapları 4 Eylül'de, insan yargısı yerine deterministik SPICE simülasyonlarını kullanarak yapay zeka tasarımlı devreleri derecelendiren yeni bir halka açık kıyaslama olan EBench biçiminde geldi. İlk sonuçlar, mevcut modellerin elektronikler hakkında çıktılarının tipik olarak gösterdiğinden çok daha fazlasını bildiğini, ancak yine de insan mühendisleri de şaşırtan gerçek dünyadaki parça davranışı konusunda başarısız olduklarını gösteriyor. For more context on this story, see our ongoing AI news.

Devre Tasarımının Neden Kendi Karşılaştırma Noktasına İhtiyacı Vardı?

Karşılaştırmayı eebench.org'da yayınlayan EEBench ekibi, deneyimlerinin mevcut modellerin ders kitaplarını, veri sayfalarını, uygulama notlarını ve büyük miktarda kodu absorbe ettiğini gösterdiğini söylüyor. Darboğaz arayüzdür. Bir aracı, KiCad gibi grafiksel bir CAD aracını çalıştırdığında, çabasının çoğunu menüler arasında tıklamaya ve ekrandakileri izlemeye harcar; bağlam penceresini elektriksel akıl yürütme yerine koordinatlar ve uygulama durumuyla tüketir.

EBench farklı bir yaklaşım benimsiyor. Karşılaştırmalı değerlendirmedeki devreler, elektroniği bildirimsel kod olarak tanımlayan bir dil olan atopil dilinde yazılmıştır, böylece aracı doğrudan bileşenler, bağlantılar ve kısıtlamalar üzerinde çalışır. Model, projeden ayrılmadan bir tasarımı değiştirebilir, onu oluşturabilir, bir simülasyon çalıştırabilir ve arızaları inceleyebilir. Ekibe göre bu, bir modelden GUI'de çizgiler çizmesini istemekten çok daha iyi çalışıyor ve karşılaştırmalı değerlendirmenin bilgisayar kullanım becerisi yerine elektronik bilgisini test etmesine olanak tanıyor.

Gerçek Parçalar, Gerçek Arızalar

Bir konut enerji sayacından bir kamu görevi alınır. 5 voltluk besleme kaybolduğunda, devrenin işlemciyi 20 milisaniye daha canlı tutması gerekir, böylece birikmiş okumaları kaydedebilir ve korumalı ray tüm süre boyunca işlemcinin 3,0 voltluk voltaj düşüklüğü eşiğinin üzerinde kalır.

Ekibin raporuna göre çoğu model hemen doğru temel sonuca ulaşıyor: bir kapasitör eklemek. Benchmark bunu göründüğünden daha da zorlaştırıyor. Gerçek bir seramik kapasitör, üzerine voltaj uygulandığında, parçalar toleranslar taşıdığında ve ekstra kapasitans maliyeti artırdığında, yer kapladığında ve güç geri geldiğinde rayın yeniden şarj edilmesini yavaşlattığında, reklamı yapılan kapasitanstan çok daha azını verebilir.

Not verenler ders kitabı cevapları ile çalışan donanım arasındaki farkı gösteren bir gönderim yakaladılar. Tasarımda nominal olarak 22 mikrofarad belirtildi; kağıt üzerinde yeterli görünen bir değer. Ancak 4,7 volt öngerilimde, sınıflayıcı yalnızca 11,4 mikrofarad etkin kapasitans ölçtü; bu da görevin 545 mikrofarad gereksiniminin çok altındaydı. Kaynak kodu başarıyla oluşturuldu. Devre hala başarısız oldu: simülasyon, korumalı rayın yalnızca 0,85 milisaniye sonra 3 volt gereksiniminin altına düştüğünü gösterdi; bu, gereken 20 milisaniyenin yakınında bile değildi.

Daha zor görevler daha da ileriye götürür. Bir analog atama, bir op-amp etrafında çoklu geri beslemeli bir alçak geçiş filtresinin sentezlenmesini, gerekli kutuplar için direnç ve kapasitör oranlarının çözülmesini ve her bileşen en kötü durum tolerans köşelerine itildiğinde bile kazanç, kesme frekansı ve Q'yu sınırlar içinde tutmayı gerektirir.

Not Verme Nasıl Çalışır?

EBench kontrolleri tamamen belirleyicidir. Donanım sunulan tasarımı oluşturur, devre grafiğini ve malzeme listesini oluşturur ve her gereksinimin sayısal bir sınıra göre bir ölçüm ürettiği bir dizi SPICE simülasyonu ve tasarım kontrolü çalıştırır. Görevler, bileşen toleransı köşelerindeki kazancı, eşikleri, dalgalanmayı, geçici yanıtı ve davranışı ölçer. Teknik puan, referans malzeme listesine göre maliyet verimliliği ölçümüyle birleştirilir; ancak maliyet yalnızca devre çalıştığında yardımcı olur.

Ekip, testlerin voltajları ve bileşen davranışını ölçmesi dışında, kurulumu bir kodlama aracısına bir derleyici ve bir test paketi vermeye benzetiyor. Versiyon 1'deki tüm görevlerde, teknik özellikler veri sayfalarından çıkarılan ve simülasyon modellerine taşınan gerçek üretici parçaları kullanılır; bu da aracıyı mevcut, sipariş edilebilir ve makul fiyatlı kombinasyonları bulmaya zorlar.

İlk Skor Tablosu

1 Eylül sonuçları, Claude Opus 5'i 13 görevde %61,6 ile EBench V1'in zirvesine yerleştirdi. Grok 4.6 %57.1 ile ikinci olurken, %56.4 ile Claude Fable 5.1'in hemen önünde yer aldı. Claude Fable 5 %54,3, Claude Opus 4,8 Max ise %51,4 puan aldı. Ekip, birkaç ay önce modellerin bu kadar iyi performans göstermesini beklemediklerini belirtiyor.

Bir sonuç özellikle ekibi memnun etti: xAI, 3D modelleme ve parametrik CAD değerlendirmelerinin yanı sıra mühendislik hızlandırma bölümüne EEEnch'i Grok 4.6 model kartına dahil etti. xAI'nin kendi yayınlanmış çalışması, xhigh muhakeme çabasıyla %60,0 oranında Grok 4,6 puan aldı. xAI'nin lansman materyallerine göre model, bilgisayar destekli tasarım da dahil olmak üzere alana özgü ortamlarda yüksek kaliteli mühendislik verileri ve takviyeli öğrenme eğitimi aldı.

OpenAI'nin şu ana kadar test edilen modelleri tablonun daha da aşağısında yer alıyor: GPT-5.5 %42,3 ve GPT-5.6 Sol %39,4 puan aldı. Henüz GPT-6 Astra sonucu yok; modelin KiCad demosunun yeniden ilgi uyandırdığı göz önüne alındığında bu dikkate değer bir boşluk. Karşılaştırmalı değerlendirme tablosunun, metodolojisinin ve örnek sonuç gezgininin tamamı halka açıktır ve laboratuvarlar kendi modellerini çalıştırabilir.

Neyi Ölçmez — Henüz

EBench V1 yalnızca simülasyon yoluyla analog ve dijital tasarımı kapsar. Henüz bir modelin fiziksel bir kart yerleştirip yerleştiremeyeceğini, üretip üretemeyeceğini veya bitmiş bir ürünü (tamamen yeni arıza modlarının ortaya çıktığı aşamalar) ortaya çıkarıp çıkaramayacağını test etmiyor. Ekip, bu aşamaları daha sonra eklemek istediğini ancak sürüm 1'e gereksinimler-tasarım-doğrulama döngüsüne odaklandığını çünkü yararlı mühendislik çalışmalarının zaten nesnel olarak derecelendirilebildiği yer olduğunu söylüyor.

Yine de, kıyaslama çok önemli bir anda iniyor. Artık bir öncü laboratuvar bundan bir model kartında bahsediyor, lansman demoları elektronikleri ön sayfaya koyuyor ve en yüksek puan (%61,6) modellerin güvenilir olmaktan uzak kalarak anlamlı bir şekilde yetenekli hale geldiğini gösteriyor. İzleyen elektrik mühendisleri için ilk EBench sonuçlarının mesajı ölçülüyor: Yapay zeka giderek daha fazla kağıt üzerinde devre tasarlayabiliyor. Gerçek parçalarla temas halinde hayatta kalıp kalamayacakları, bu kıyaslamanın tam olarak ortaya çıkarılması gereken şeydir.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →