هنگامی که OpenAI این هفته از GPT-6 Astra رونمایی کرد، یک نسخه ی نمایشی توجه ویژه ای را از مخاطبانی که به ندرت در راه اندازی مدل های مرزی فریاد می زنند، جلب کرد: مهندسان برق. پست پرتاب مدل طراحی یک برد مدار را در KiCad، ابزار طراحی الکترونیک منبع باز، نشان داد. اما تیم کوچکی از مهندسان سؤال سخت‌تری را مطرح کرده‌اند - نه اینکه آیا مدل‌های هوش مصنوعی می‌توانند نرم‌افزارهای الکترونیکی را کار کنند، بلکه آیا مدارهایی که تولید می‌کنند واقعاً کار می‌کنند یا خیر.

پاسخ آنها در 4 سپتامبر در قالب EEBench، یک معیار عمومی جدید که مدارهای طراحی شده با هوش مصنوعی را با استفاده از شبیه سازی های قطعی SPICE به جای قضاوت انسان درجه بندی می کند، دریافت شد. نتایج اولیه نشان می‌دهد که مدل‌های فعلی بسیار بیشتر از آنچه که خروجی‌شان نشان می‌دهد، در مورد الکترونیک می‌دانند، با این حال هنوز در نوع رفتار قطعه در دنیای واقعی که مهندسان انسانی را نیز به چالش می‌کشد، شکست می‌خورند. For more context on this story, see our ongoing AI industry coverage.

چرا طراحی مدار به معیار خاص خود نیاز دارد

تیم EEBench که این معیار را در eebench.org منتشر می‌کند، می‌گوید که تجربه‌اش نشان می‌دهد که مدل‌های فعلی کتاب‌های درسی، برگه‌های داده، یادداشت‌های کاربردی و مقادیر زیادی کد را جذب کرده‌اند. گلوگاه رابط است. وقتی یک عامل از یک ابزار گرافیکی CAD مانند KiCad استفاده می‌کند، بیشتر تلاش خود را صرف کلیک کردن روی منوها و ردیابی آنچه روی صفحه است می‌کند و پنجره زمینه آن را با مختصات و حالت برنامه مصرف می‌کند تا استدلال الکتریکی.

EEBench رویکرد متفاوتی دارد. مدارهای موجود در معیار به زبان atopile نوشته شده‌اند، زبانی که الکترونیک را به‌عنوان کد اعلامی توصیف می‌کند، بنابراین عامل مستقیماً روی مؤلفه‌ها، اتصالات و محدودیت‌ها کار می‌کند. این مدل می‌تواند یک طرح را اصلاح کند، آن را بسازد، یک شبیه‌سازی را اجرا کند و خرابی‌ها را بدون ترک پروژه بررسی کند. به گفته این تیم، این کار بسیار بهتر از درخواست از یک مدل برای ترسیم خطوط در یک رابط کاربری گرافیکی است - و به معیار اجازه می‌دهد دانش الکترونیک را به جای مهارت استفاده از رایانه آزمایش کند.

قطعات واقعی، شکست های واقعی

یک کار عمومی از یک کنتور انرژی مسکونی استخراج می شود. هنگامی که منبع تغذیه 5 ولتی آن ناپدید می شود، مدار باید پردازنده را برای 20 میلی ثانیه دیگر زنده نگه دارد تا بتواند قرائت های انباشته شده را ذخیره کند و ریل محافظت شده در تمام مدت بالاتر از آستانه خاموشی 3.0 ولتی پردازنده بماند.

تیم گزارش می دهد که اکثر مدل ها بلافاصله به نتیجه گیری پایه درست می رسند: یک خازن اضافه کنید. معیار آن را سخت تر از آنچه به نظر می رسد می کند. یک خازن سرامیکی واقعی ممکن است به محض اعمال ولتاژ در سراسر آن، بسیار کمتر از ظرفیت اعلام شده خود باشد، قطعات تحمل تحمل دارند، و ظرفیت اضافی هزینه را افزایش می دهد، فضا را اشغال می کند و با بازگشت برق، شارژ مجدد ریل را کاهش می دهد.

دانش‌آموزان یک مورد را دریافت کردند که شکاف بین پاسخ‌های کتاب درسی و سخت‌افزار کار را نشان می‌دهد. یک طرح به طور اسمی 22 میکروفاراد را مشخص می کند - مقداری که روی کاغذ کافی به نظر می رسد. اما در 4.7 ولت بایاس، گریدر تنها 11.4 میکروفاراد ظرفیت موثر اندازه گیری کرد که بسیار کمتر از نیاز 545 میکروفاراد کار است. کد منبع با موفقیت ساخته شد. مدار هنوز شکست خورد: شبیه‌سازی نشان داد که ریل محافظت‌شده تنها پس از 0.85 میلی‌ثانیه به زیر ولتاژ مورد نیاز 3 ولت می‌افتد، در حالی که نزدیک به 20 میلی‌ثانیه نیست.

کارهای سخت تر جلوتر می روند. یک انتساب آنالوگ مستلزم سنتز یک فیلتر کم گذر چند بازخوردی در اطراف یک آپ امپ، حل نسبت مقاومت و خازن برای قطب های مورد نیاز، و حفظ بهره، فرکانس قطع، و Q در محدوده است، حتی زمانی که هر جزء به گوشه های تحمل بدترین حالت فشار داده می شود.

چگونه درجه بندی کار می کند

چک های EEBench کاملا قطعی هستند. مهار طرح ارائه شده را می سازد، نمودار مدار و صورتحساب مواد را می سازد، و مجموعه ای از شبیه سازی ها و بررسی های طراحی SPICE را اجرا می کند، با هر نیاز اندازه گیری در برابر یک حد عددی. وظایف، افزایش، آستانه، ریپل، پاسخ گذرا و رفتار را در گوشه‌های تحمل مولفه اندازه‌گیری می‌کنند. امتیاز فنی با یک معیار کارآمدی هزینه در برابر صورتحساب مواد مرجع ترکیب می شود - اگرچه هزینه فقط زمانی کمک می کند که مدار کار کند.

این تیم راه‌اندازی را با دادن یک کامپایلر و یک مجموعه آزمایشی به یک عامل کدنویس مقایسه می‌کند، به جز اینکه آزمایش‌ها ولتاژ و رفتار اجزا را اندازه‌گیری می‌کنند. همه وظایف در نسخه 1 از قطعات سازنده واقعی استفاده می‌کنند، با مشخصاتی که از دیتاشیت‌ها استخراج شده و در مدل‌های شبیه‌سازی قرار می‌گیرد، و عامل را مجبور می‌کند ترکیب‌هایی را پیدا کند که وجود دارند، قابل سفارش هستند و قیمت مناسبی دارند.

اولین جدول امتیازات

نتایج از 1 سپتامبر، Claude Opus 5 را در صدر EEBench V1 با 61.6% در 13 وظیفه قرار داد. Grok 4.6 با 57.1% در رتبه دوم قرار گرفت، درست جلوتر از Claude Fable 5.1 با 56.4%. Claude Fable 5 54.3% و Claude Opus 4.8 Max امتیاز 51.4% را به دست آوردند. این تیم خاطرنشان می کند که چند ماه پیش انتظار نداشتند مدل ها این کار را به خوبی انجام دهند.

یک نتیجه به ویژه تیم را خوشحال کرد: xAI EEBench را در کارت مدل Grok 4.6 در بخشی در مورد شتاب مهندسی در کنار مدل‌سازی سه بعدی و ارزیابی‌های پارامتریک CAD قرار داد. اجرا منتشر شده خود xAI با تلاش استدلالی عالی امتیاز Grok 4.6 در 60.0٪ را کسب کرد. با توجه به مواد راه اندازی xAI، این مدل داده های مهندسی با کیفیت بالا و آموزش یادگیری تقویتی را در محیط های خاص دامنه، از جمله طراحی به کمک رایانه دریافت کرد.

مدل‌های OpenAI که تاکنون آزمایش شده‌اند در پایین‌تر از جدول قرار دارند: GPT-5.5 امتیاز 42.3٪ و GPT-5.6 Sol امتیاز 39.4٪ را کسب کرد. هنوز هیچ نتیجه ای از GPT-6 Astra وجود ندارد - یک شکاف قابل توجه با توجه به اینکه نسخه ی نمایشی KiCad مدل باعث جلب توجه مجدد شد. جدول امتیازات معیار، روش‌شناسی و جستجوگر نتایج نمونه همگی عمومی هستند و آزمایشگاه‌ها می‌توانند مدل‌های خود را اجرا کنند.

آنچه را اندازه گیری نمی کند - هنوز

EEBench V1 طراحی آنالوگ و دیجیتال را فقط از طریق شبیه سازی پوشش می دهد. هنوز آزمایش نمی‌کند که آیا یک مدل می‌تواند یک برد فیزیکی را بسازد، آن را بسازد یا یک محصول نهایی را ارائه دهد - مراحلی که حالت‌های شکست کاملاً جدید ظاهر می‌شوند. این تیم می‌گوید که می‌خواهد آن مراحل را بعداً اضافه کند، اما نسخه 1 را روی حلقه مورد نیاز-طراحی-تأیید‌سنجی متمرکز کرده است، زیرا اینجاست که کارهای مهندسی مفید را می‌توان به صورت عینی درجه‌بندی کرد.

با این حال، معیار در یک لحظه مشخص به دست می‌آید. اکنون یک آزمایشگاه مرزی آن را در یک کارت مدل ذکر می‌کند، نسخه‌های نمایشی راه‌اندازی لوازم الکترونیکی را در صفحه اول قرار می‌دهد، و امتیاز برتر - 61.6٪ - نشان می‌دهد که مدل‌ها به طور معناداری توانمند هستند در حالی که از قابل اعتماد بودن فاصله دارند. برای مهندسان برقی که در حال تماشا هستند، پیام اولین نتایج EEBench اندازه‌گیری می‌شود: هوش مصنوعی می‌تواند به طور فزاینده‌ای مدارها را روی کاغذ طراحی کند. اینکه آیا آنها از تماس با قطعات واقعی جان سالم به در می‌برند، دقیقاً همان چیزی است که این معیار برای کشف وجود دارد.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →