Apabila OpenAI melancarkan GPT-6 Astra minggu ini, satu demo menarik perhatian khusus daripada khalayak yang jarang mendapat jeritan semasa pelancaran model sempadan: jurutera elektrik. Jawatan pelancaran memaparkan model mereka bentuk papan litar dalam KiCad, alat reka bentuk elektronik sumber terbuka. Tetapi sekumpulan kecil jurutera telah bertanya soalan yang lebih sukar - bukan sama ada model AI boleh mengendalikan perisian elektronik, tetapi sama ada litar yang mereka hasilkan benar-benar berfungsi.

Jawapan mereka tiba pada 4 September dalam bentuk EEBench, penanda aras awam baharu yang menggredkan litar rekaan AI menggunakan simulasi SPICE yang menentukan dan bukannya pertimbangan manusia. Keputusan awal mencadangkan model semasa mengetahui lebih banyak tentang elektronik daripada yang biasanya ditunjukkan oleh output mereka, namun masih gagal pada jenis tingkah laku bahagian dunia sebenar yang menjejas jurutera manusia juga. For more context on this story, see our ongoing AI news.

Mengapa Reka Bentuk Litar Memerlukan Penanda Arasnya Sendiri

Pasukan EEBench, yang menerbitkan penanda aras di eebench.org, berkata pengalamannya menunjukkan model semasa telah menyerap buku teks, lembaran data, nota aplikasi dan sejumlah besar kod. Halangan adalah antara muka. Apabila ejen mengendalikan alat CAD grafik seperti KiCad, ia menghabiskan banyak usahanya dengan mengklik menu dan menjejaki apa yang ada pada skrin, menggunakan tetingkap konteksnya dengan koordinat dan keadaan aplikasi berbanding penaakulan elektrik.

EEBench mengambil pendekatan yang berbeza. Litar dalam penanda aras ditulis dalam atopile, bahasa yang menerangkan elektronik sebagai kod perisytiharan, jadi ejen berfungsi secara langsung pada komponen, sambungan dan kekangan. Model boleh mengubah suai reka bentuk, membinanya, menjalankan simulasi dan memeriksa kegagalan tanpa meninggalkan projek. Menurut pasukan itu, ini berfungsi jauh lebih baik daripada meminta model melukis garisan dalam GUI — dan ia membenarkan penanda aras menguji pengetahuan elektronik dan bukannya kemahiran penggunaan komputer.

Bahagian Sebenar, Kegagalan Sebenar

Satu tugas awam diambil daripada meter tenaga kediaman. Apabila bekalan 5 voltnya hilang, litar mesti memastikan pemproses hidup selama 20 milisaat lagi supaya ia dapat menjimatkan bacaan terkumpul, dengan rel terlindung kekal di atas ambang 3.0 volt brownout pemproses sepanjang masa.

Kebanyakan model, laporan pasukan, segera mencapai kesimpulan asas yang betul: tambah kapasitor. Penanda aras menjadikannya lebih sukar daripada yang didengari. Kapasitor seramik sebenar mungkin menghantar jauh lebih rendah daripada kapasitansi yang diiklankan sebaik sahaja voltan digunakan merentasinya, bahagian membawa had terima, dan kapasitans tambahan menambah kos, mengambil ruang dan memperlahankan pengecasan semula rel apabila kuasa kembali.

Penggred menangkap satu penyerahan yang menggambarkan jurang antara jawapan buku teks dan perkakasan yang berfungsi. Reka bentuk menetapkan 22 mikrofarad secara nominal — nilai yang kelihatan mencukupi di atas kertas. Tetapi pada 4.7 volt pincang, penggred mengukur hanya 11.4 mikrofarad kemuatan berkesan, jauh di bawah keperluan 545 mikrofarad tugas itu. Kod sumber berjaya dibina. Litar masih gagal: simulasi menunjukkan rel yang dilindungi jatuh di bawah keperluan 3 volt selepas hanya 0.85 milisaat, tidak menghampiri 20 yang diperlukan.

Tugas yang lebih sukar diteruskan. Satu tugasan analog memerlukan mensintesis penapis laluan rendah berbilang maklum balas di sekeliling op-amp, penyelesaian perintang dan nisbah kapasitor untuk kutub yang diperlukan, dan mengekalkan keuntungan, kekerapan potong dan Q dalam had walaupun setiap komponen ditolak ke sudut toleransi kes terburuk.

Bagaimana Penggredan Berfungsi

Pemeriksaan EEBench adalah deterministik sepenuhnya. Abah-abah membina reka bentuk yang diserahkan, membina graf litar dan bil bahan, dan menjalankan satu set simulasi SPICE dan semakan reka bentuk, dengan setiap keperluan menghasilkan ukuran terhadap had berangka. Tugas mengukur keuntungan, ambang, riak, tindak balas sementara dan tingkah laku di sudut toleransi komponen. Skor teknikal digabungkan dengan ukuran kecekapan kos terhadap bil bahan rujukan — walaupun kos hanya membantu sebaik sahaja litar berfungsi.

Pasukan itu membandingkan persediaan dengan memberi agen pengekodan pengkompil dan suite ujian, kecuali ujian mengukur voltan dan gelagat komponen. Semua tugasan dalam versi 1 menggunakan bahagian pengilang sebenar, dengan spesifikasi yang diekstrak daripada lembaran data dan dibawa ke dalam model simulasi, memaksa ejen mencari kombinasi yang wujud, boleh dipesan dan harga yang berpatutan.

Papan Pendahulu Pertama

Keputusan dari 1 September meletakkan Claude Opus 5 di bahagian atas EEBench V1 dengan 61.6% merentas 13 tugasan. Grok 4.6 menduduki tempat kedua pada 57.1%, hanya di hadapan Claude Fable 5.1 pada 56.4%. Claude Fable 5 mendapat 54.3% dan Claude Opus 4.8 Max 51.4%. Pasukan itu menyatakan bahawa beberapa bulan yang lalu ia tidak menjangkakan model untuk melaksanakannya dengan baik.

Satu keputusan menggembirakan pasukan terutamanya: xAI memasukkan EEBench dalam kad model Grok 4.6, dalam bahagian tentang pecutan kejuruteraan bersama pemodelan 3D dan penilaian CAD parametrik. Larian xAI yang diterbitkan sendiri mencatatkan Grok 4.6 pada 60.0% dengan usaha penaakulan xtinggi. Menurut bahan pelancaran xAI, model itu menerima data kejuruteraan berkualiti tinggi dan latihan pembelajaran pengukuhan dalam persekitaran khusus domain, termasuk reka bentuk bantuan komputer.

Model OpenAI yang diuji setakat ini berada di bawah jadual: GPT-5.5 mendapat 42.3% dan GPT-5.6 Sol 39.4%. Belum ada keputusan GPT-6 Astra — jurang yang ketara memandangkan demo KiCad model itu mencetuskan perhatian baharu. Papan pendahulu, metodologi dan contoh peneroka hasil penanda aras semuanya awam dan makmal boleh menjalankan model mereka sendiri.

Perkara Yang Tidak Diukur — Namun

EEBench V1 merangkumi reka bentuk analog dan digital melalui simulasi sahaja. Ia belum lagi menguji sama ada model boleh meletakkan papan fizikal, mengeluarkannya atau mengeluarkan produk siap — peringkat di mana mod kegagalan sepenuhnya baharu muncul. Pasukan itu berkata ia mahu menambah peringkat tersebut kemudian, tetapi memfokuskan versi 1 pada gelung pengesahan reka bentuk keperluan kerana di situlah kerja kejuruteraan yang berguna sudah boleh digredkan secara objektif.

Namun, penanda aras itu tiba pada saat yang jelas. Makmal sempadan kini menyebutnya dalam kad model, melancarkan tunjuk cara meletakkan elektronik di halaman depan, dan skor tertinggi — 61.6% — menunjukkan model menjadi mampu secara bermakna sambil kekal jauh daripada boleh dipercayai. Bagi jurutera elektrik yang menonton, mesej daripada keputusan EEBench pertama diukur: AI boleh semakin mereka bentuk litar di atas kertas. Sama ada mereka bertahan bersentuhan dengan bahagian sebenar, itulah tanda aras yang perlu diketahui.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →