जब OpenAI ने इस सप्ताह GPT-6 एस्ट्रा का अनावरण किया, तो एक डेमो ने उन दर्शकों का विशेष ध्यान आकर्षित किया, जिन्हें शायद ही कभी फ्रंटियर मॉडल लॉन्च पर चिल्लाया जाता है: इलेक्ट्रिकल इंजीनियर। लॉन्च पोस्ट में ओपन-सोर्स इलेक्ट्रॉनिक्स डिज़ाइन टूल KiCad में एक सर्किट बोर्ड डिजाइन करने वाले मॉडल को दिखाया गया है। लेकिन इंजीनियरों की एक छोटी सी टीम एक कठिन सवाल पूछ रही है - यह नहीं कि क्या एआई मॉडल इलेक्ट्रॉनिक्स सॉफ्टवेयर संचालित कर सकते हैं, बल्कि यह कि क्या उनके द्वारा उत्पादित सर्किट वास्तव में काम करते हैं।

उनका जवाब 4 सितंबर को ईईबेंच के रूप में आया, एक नया सार्वजनिक बेंचमार्क जो मानव निर्णय के बजाय नियतात्मक स्पाइस सिमुलेशन का उपयोग करके एआई-डिज़ाइन किए गए सर्किट को ग्रेड करता है। शुरुआती नतीजों से पता चलता है कि वर्तमान मॉडल इलेक्ट्रॉनिक्स के बारे में अपने आउटपुट से कहीं अधिक जानते हैं, फिर भी वे वास्तविक दुनिया के उस तरह के व्यवहार में विफल रहते हैं जो मानव इंजीनियरों को भी परेशान करता है। For more context on this story, see our ongoing latest AI developments.

सर्किट डिज़ाइन को अपने स्वयं के बेंचमार्क की आवश्यकता क्यों है

EEBench टीम, जो eebench.org पर बेंचमार्क प्रकाशित करती है, का कहना है कि उसके अनुभव से पता चलता है कि मौजूदा मॉडल ने पाठ्यपुस्तकों, डेटाशीट, एप्लिकेशन नोट्स और बड़ी मात्रा में कोड को अवशोषित कर लिया है। अड़चन इंटरफ़ेस है. जब कोई एजेंट KiCad जैसे ग्राफ़िकल CAD टूल को संचालित करता है, तो वह अपना अधिकांश प्रयास मेनू के माध्यम से क्लिक करने और स्क्रीन पर क्या है उसे ट्रैक करने में खर्च करता है, विद्युत तर्क के बजाय निर्देशांक और एप्लिकेशन स्थिति के साथ अपनी संदर्भ विंडो का उपभोग करता है।

ईईबेंच एक अलग दृष्टिकोण अपनाता है। बेंचमार्क में सर्किट एटोपाइल में लिखे गए हैं, एक ऐसी भाषा जो इलेक्ट्रॉनिक्स को घोषणात्मक कोड के रूप में वर्णित करती है, इसलिए एजेंट सीधे घटकों, कनेक्शन और बाधाओं पर काम करता है। मॉडल किसी डिज़ाइन को संशोधित कर सकता है, उसका निर्माण कर सकता है, सिमुलेशन चला सकता है और प्रोजेक्ट छोड़े बिना विफलताओं का निरीक्षण कर सकता है। टीम के अनुसार, यह किसी मॉडल को जीयूआई में रेखाएं खींचने के लिए कहने से कहीं बेहतर काम करता है - और यह बेंचमार्क को कंप्यूटर-उपयोग कौशल के बजाय इलेक्ट्रॉनिक्स ज्ञान का परीक्षण करने देता है।

वास्तविक भाग, वास्तविक विफलताएँ

एक सार्वजनिक कार्य आवासीय ऊर्जा मीटर से लिया गया है। जब इसकी 5-वोल्ट आपूर्ति गायब हो जाती है, तो सर्किट को प्रोसेसर को अन्य 20 मिलीसेकंड तक सक्रिय रखना चाहिए ताकि यह संचित रीडिंग को बचा सके, साथ ही संरक्षित रेल पूरे समय प्रोसेसर के 3.0-वोल्ट ब्राउनआउट थ्रेशोल्ड से ऊपर रहती है।

टीम की रिपोर्ट के अनुसार अधिकांश मॉडल तुरंत सही आधार निष्कर्ष पर पहुंच जाते हैं: एक संधारित्र जोड़ें। बेंचमार्क इसे सुनने में जितना कठिन लगता है, उससे कहीं अधिक कठिन बनाता है। एक वास्तविक सिरेमिक कैपेसिटर अपने विज्ञापित कैपेसिटेंस की तुलना में बहुत कम काम कर सकता है, जब उस पर वोल्टेज लगाया जाता है, भागों में सहनशीलता होती है, और अतिरिक्त कैपेसिटेंस लागत बढ़ाता है, जगह लेता है, और बिजली वापस आने पर रेल के रिचार्ज को धीमा कर देता है।

ग्रेडर्स ने एक सबमिशन पकड़ा जो पाठ्यपुस्तक के उत्तरों और कामकाजी हार्डवेयर के बीच अंतर को दर्शाता है। एक डिज़ाइन में नाममात्र रूप से 22 माइक्रोफ़ारड निर्दिष्ट किए गए - एक ऐसा मान जो कागज़ पर पर्याप्त दिखता है। लेकिन 4.7 वोल्ट के पूर्वाग्रह पर, ग्रेडर ने प्रभावी कैपेसिटेंस के केवल 11.4 माइक्रोफ़ारड को मापा, जो कार्य की 545-माइक्रोफ़ारड आवश्यकता से बहुत कम था। स्रोत कोड सफलतापूर्वक बनाया गया. सर्किट अभी भी विफल रहा: सिमुलेशन ने दिखाया कि संरक्षित रेल केवल 0.85 मिलीसेकंड के बाद 3-वोल्ट आवश्यकता से नीचे गिर रही है, आवश्यक 20 के आसपास भी नहीं।

कठिन कार्य आगे बढ़ते हैं। एक एनालॉग असाइनमेंट के लिए एक ऑप-एम्प के चारों ओर एक मल्टीपल-फीडबैक लो-पास फिल्टर को संश्लेषित करने, आवश्यक ध्रुवों के लिए प्रतिरोधी और कैपेसिटर अनुपात को हल करने और प्रत्येक घटक को सबसे खराब स्थिति वाले सहनशीलता कोनों में धकेलने पर भी लाभ, कटऑफ आवृत्ति और क्यू को सीमा के भीतर रखने की आवश्यकता होती है।

ग्रेडिंग कैसे काम करती है

ईईबेंच जांच पूरी तरह से नियतात्मक हैं। हार्नेस सबमिट किए गए डिज़ाइन का निर्माण करता है, सर्किट ग्राफ़ और सामग्रियों के बिल का निर्माण करता है, और SPICE सिमुलेशन और डिज़ाइन जांच का एक सेट चलाता है, प्रत्येक आवश्यकता के साथ एक संख्यात्मक सीमा के विरुद्ध माप उत्पन्न करता है। कार्य घटक-सहिष्णुता कोनों पर लाभ, सीमा, तरंग, क्षणिक प्रतिक्रिया और व्यवहार को मापते हैं। तकनीकी स्कोर को सामग्री के संदर्भ बिल के विरुद्ध लागत-दक्षता माप के साथ जोड़ा जाता है - हालांकि लागत केवल तभी मदद करती है जब सर्किट काम करता है।

टीम सेटअप की तुलना कोडिंग एजेंट को एक कंपाइलर और एक टेस्ट सूट देने से करती है, सिवाय इसके कि परीक्षण वोल्टेज और घटक व्यवहार को मापते हैं। संस्करण 1 में सभी कार्य वास्तविक निर्माता भागों का उपयोग करते हैं, डेटाशीट से निकाले गए विनिर्देशों के साथ और सिमुलेशन मॉडल में ले जाया जाता है, जिससे एजेंट को ऐसे संयोजन ढूंढने के लिए मजबूर किया जाता है जो मौजूद हैं, ऑर्डर किए जा सकते हैं, और उचित मूल्य हैं।

पहला लीडरबोर्ड

1 सितंबर के परिणामों ने क्लाउड ओपस 5 को 13 कार्यों में 61.6% के साथ ईईबेंच वी1 के शीर्ष पर रखा। ग्रोक 4.6 57.1% के साथ दूसरे स्थान पर रहा, जो क्लाउड फैबल 5.1 से 56.4% से थोड़ा आगे रहा। क्लाउड फैबल 5 ने 54.3% और क्लाउड ओपस 4.8 मैक्स ने 51.4% स्कोर किया। टीम का कहना है कि कुछ महीने पहले उसे मॉडलों से इतना अच्छा प्रदर्शन करने की उम्मीद नहीं थी।

एक परिणाम ने टीम को विशेष रूप से प्रसन्न किया: एक्सएआई ने 3डी मॉडलिंग और पैरामीट्रिक सीएडी मूल्यांकन के साथ-साथ इंजीनियरिंग त्वरण पर एक अनुभाग में ग्रोक 4.6 मॉडल कार्ड में ईईबेंच को शामिल किया। xAI के स्वयं के प्रकाशित रन ने xhigh तर्क प्रयास के साथ 60.0% पर ग्रोक 4.6 स्कोर किया। एक्सएआई की लॉन्च सामग्री के अनुसार, मॉडल को कंप्यूटर-एडेड डिज़ाइन सहित डोमेन-विशिष्ट वातावरण में उच्च गुणवत्ता वाले इंजीनियरिंग डेटा और सुदृढीकरण सीखने का प्रशिक्षण प्राप्त हुआ।

OpenAI के अब तक परीक्षण किए गए मॉडल तालिका में और नीचे हैं: GPT-5.5 ने 42.3% और GPT-5.6 Sol ने 39.4% स्कोर किया। अभी तक कोई GPT-6 एस्ट्रा परिणाम नहीं है - एक उल्लेखनीय अंतर यह देखते हुए कि मॉडल के KiCad डेमो ने नए सिरे से ध्यान आकर्षित किया है। बेंचमार्क के लीडरबोर्ड, कार्यप्रणाली और नमूना परिणाम एक्सप्लोरर सभी सार्वजनिक हैं, और प्रयोगशालाएं अपने स्वयं के मॉडल चला सकती हैं।

यह क्या नहीं मापता - फिर भी

ईईबेंच V1 केवल सिमुलेशन के माध्यम से एनालॉग और डिजिटल डिज़ाइन को कवर करता है। यह अभी तक परीक्षण नहीं करता है कि क्या कोई मॉडल एक भौतिक बोर्ड बिछा सकता है, उसका निर्माण कर सकता है, या एक तैयार उत्पाद ला सकता है - ऐसे चरण जहां पूरी तरह से नए विफलता मोड दिखाई देते हैं। टीम का कहना है कि वह उन चरणों को बाद में जोड़ना चाहती है, लेकिन संस्करण 1 को आवश्यकताओं-डिज़ाइन-सत्यापन लूप पर केंद्रित किया है क्योंकि यहीं पर उपयोगी इंजीनियरिंग कार्य को पहले से ही निष्पक्ष रूप से वर्गीकृत किया जा सकता है।

फिर भी, बेंचमार्क एक स्पष्ट क्षण पर पहुँचता है। एक फ्रंटियर लैब अब इसे एक मॉडल कार्ड में उद्धृत करती है, लॉन्च डेमो ने इलेक्ट्रॉनिक्स को पहले पन्ने पर रखा है, और शीर्ष स्कोर - 61.6% - दिखाता है कि मॉडल विश्वसनीय से दूर रहते हुए भी सार्थक रूप से सक्षम हो रहे हैं। इलेक्ट्रिकल इंजीनियरों के लिए, पहले ईईबेंच परिणामों का संदेश मापा जाता है: एआई तेजी से कागज पर सर्किट डिजाइन कर सकता है। क्या वे वास्तविक भागों के संपर्क में जीवित रहते हैं या नहीं, यह पता लगाने के लिए यह बेंचमार्क मौजूद है।

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →