هنگامی که OpenAI این هفته از GPT-6 Astra رونمایی کرد، یک نسخه ی نمایشی توجه ویژه ای را از مخاطبانی که به ندرت در راه اندازی مدل های مرزی فریاد می زنند، جلب کرد: مهندسان برق. پست پرتاب مدل طراحی یک برد مدار را در KiCad، ابزار طراحی الکترونیک منبع باز، نشان داد. اما تیم کوچکی از مهندسان سؤال سختتری را مطرح کردهاند - نه اینکه آیا مدلهای هوش مصنوعی میتوانند نرمافزارهای الکترونیکی را کار کنند، بلکه آیا مدارهایی که تولید میکنند واقعاً کار میکنند یا خیر.
پاسخ آنها در 4 سپتامبر در قالب EEBench، یک معیار عمومی جدید که مدارهای طراحی شده با هوش مصنوعی را با استفاده از شبیه سازی های قطعی SPICE به جای قضاوت انسان درجه بندی می کند، دریافت شد. نتایج اولیه نشان میدهد که مدلهای فعلی بسیار بیشتر از آنچه که خروجیشان نشان میدهد، در مورد الکترونیک میدانند، با این حال هنوز در نوع رفتار قطعه در دنیای واقعی که مهندسان انسانی را نیز به چالش میکشد، شکست میخورند. For more context on this story, see our ongoing AI industry coverage.
چرا طراحی مدار به معیار خاص خود نیاز دارد
تیم EEBench که این معیار را در eebench.org منتشر میکند، میگوید که تجربهاش نشان میدهد که مدلهای فعلی کتابهای درسی، برگههای داده، یادداشتهای کاربردی و مقادیر زیادی کد را جذب کردهاند. گلوگاه رابط است. وقتی یک عامل از یک ابزار گرافیکی CAD مانند KiCad استفاده میکند، بیشتر تلاش خود را صرف کلیک کردن روی منوها و ردیابی آنچه روی صفحه است میکند و پنجره زمینه آن را با مختصات و حالت برنامه مصرف میکند تا استدلال الکتریکی.
EEBench رویکرد متفاوتی دارد. مدارهای موجود در معیار به زبان atopile نوشته شدهاند، زبانی که الکترونیک را بهعنوان کد اعلامی توصیف میکند، بنابراین عامل مستقیماً روی مؤلفهها، اتصالات و محدودیتها کار میکند. این مدل میتواند یک طرح را اصلاح کند، آن را بسازد، یک شبیهسازی را اجرا کند و خرابیها را بدون ترک پروژه بررسی کند. به گفته این تیم، این کار بسیار بهتر از درخواست از یک مدل برای ترسیم خطوط در یک رابط کاربری گرافیکی است - و به معیار اجازه میدهد دانش الکترونیک را به جای مهارت استفاده از رایانه آزمایش کند.
قطعات واقعی، شکست های واقعی
یک کار عمومی از یک کنتور انرژی مسکونی استخراج می شود. هنگامی که منبع تغذیه 5 ولتی آن ناپدید می شود، مدار باید پردازنده را برای 20 میلی ثانیه دیگر زنده نگه دارد تا بتواند قرائت های انباشته شده را ذخیره کند و ریل محافظت شده در تمام مدت بالاتر از آستانه خاموشی 3.0 ولتی پردازنده بماند.
تیم گزارش می دهد که اکثر مدل ها بلافاصله به نتیجه گیری پایه درست می رسند: یک خازن اضافه کنید. معیار آن را سخت تر از آنچه به نظر می رسد می کند. یک خازن سرامیکی واقعی ممکن است به محض اعمال ولتاژ در سراسر آن، بسیار کمتر از ظرفیت اعلام شده خود باشد، قطعات تحمل تحمل دارند، و ظرفیت اضافی هزینه را افزایش می دهد، فضا را اشغال می کند و با بازگشت برق، شارژ مجدد ریل را کاهش می دهد.
دانشآموزان یک مورد را دریافت کردند که شکاف بین پاسخهای کتاب درسی و سختافزار کار را نشان میدهد. یک طرح به طور اسمی 22 میکروفاراد را مشخص می کند - مقداری که روی کاغذ کافی به نظر می رسد. اما در 4.7 ولت بایاس، گریدر تنها 11.4 میکروفاراد ظرفیت موثر اندازه گیری کرد که بسیار کمتر از نیاز 545 میکروفاراد کار است. کد منبع با موفقیت ساخته شد. مدار هنوز شکست خورد: شبیهسازی نشان داد که ریل محافظتشده تنها پس از 0.85 میلیثانیه به زیر ولتاژ مورد نیاز 3 ولت میافتد، در حالی که نزدیک به 20 میلیثانیه نیست.
کارهای سخت تر جلوتر می روند. یک انتساب آنالوگ مستلزم سنتز یک فیلتر کم گذر چند بازخوردی در اطراف یک آپ امپ، حل نسبت مقاومت و خازن برای قطب های مورد نیاز، و حفظ بهره، فرکانس قطع، و Q در محدوده است، حتی زمانی که هر جزء به گوشه های تحمل بدترین حالت فشار داده می شود.
چگونه درجه بندی کار می کند
چک های EEBench کاملا قطعی هستند. مهار طرح ارائه شده را می سازد، نمودار مدار و صورتحساب مواد را می سازد، و مجموعه ای از شبیه سازی ها و بررسی های طراحی SPICE را اجرا می کند، با هر نیاز اندازه گیری در برابر یک حد عددی. وظایف، افزایش، آستانه، ریپل، پاسخ گذرا و رفتار را در گوشههای تحمل مولفه اندازهگیری میکنند. امتیاز فنی با یک معیار کارآمدی هزینه در برابر صورتحساب مواد مرجع ترکیب می شود - اگرچه هزینه فقط زمانی کمک می کند که مدار کار کند.
این تیم راهاندازی را با دادن یک کامپایلر و یک مجموعه آزمایشی به یک عامل کدنویس مقایسه میکند، به جز اینکه آزمایشها ولتاژ و رفتار اجزا را اندازهگیری میکنند. همه وظایف در نسخه 1 از قطعات سازنده واقعی استفاده میکنند، با مشخصاتی که از دیتاشیتها استخراج شده و در مدلهای شبیهسازی قرار میگیرد، و عامل را مجبور میکند ترکیبهایی را پیدا کند که وجود دارند، قابل سفارش هستند و قیمت مناسبی دارند.
اولین جدول امتیازات
نتایج از 1 سپتامبر، Claude Opus 5 را در صدر EEBench V1 با 61.6% در 13 وظیفه قرار داد. Grok 4.6 با 57.1% در رتبه دوم قرار گرفت، درست جلوتر از Claude Fable 5.1 با 56.4%. Claude Fable 5 54.3% و Claude Opus 4.8 Max امتیاز 51.4% را به دست آوردند. این تیم خاطرنشان می کند که چند ماه پیش انتظار نداشتند مدل ها این کار را به خوبی انجام دهند.
یک نتیجه به ویژه تیم را خوشحال کرد: xAI EEBench را در کارت مدل Grok 4.6 در بخشی در مورد شتاب مهندسی در کنار مدلسازی سه بعدی و ارزیابیهای پارامتریک CAD قرار داد. اجرا منتشر شده خود xAI با تلاش استدلالی عالی امتیاز Grok 4.6 در 60.0٪ را کسب کرد. با توجه به مواد راه اندازی xAI، این مدل داده های مهندسی با کیفیت بالا و آموزش یادگیری تقویتی را در محیط های خاص دامنه، از جمله طراحی به کمک رایانه دریافت کرد.
مدلهای OpenAI که تاکنون آزمایش شدهاند در پایینتر از جدول قرار دارند: GPT-5.5 امتیاز 42.3٪ و GPT-5.6 Sol امتیاز 39.4٪ را کسب کرد. هنوز هیچ نتیجه ای از GPT-6 Astra وجود ندارد - یک شکاف قابل توجه با توجه به اینکه نسخه ی نمایشی KiCad مدل باعث جلب توجه مجدد شد. جدول امتیازات معیار، روششناسی و جستجوگر نتایج نمونه همگی عمومی هستند و آزمایشگاهها میتوانند مدلهای خود را اجرا کنند.
آنچه را اندازه گیری نمی کند - هنوز
EEBench V1 طراحی آنالوگ و دیجیتال را فقط از طریق شبیه سازی پوشش می دهد. هنوز آزمایش نمیکند که آیا یک مدل میتواند یک برد فیزیکی را بسازد، آن را بسازد یا یک محصول نهایی را ارائه دهد - مراحلی که حالتهای شکست کاملاً جدید ظاهر میشوند. این تیم میگوید که میخواهد آن مراحل را بعداً اضافه کند، اما نسخه 1 را روی حلقه مورد نیاز-طراحی-تأییدسنجی متمرکز کرده است، زیرا اینجاست که کارهای مهندسی مفید را میتوان به صورت عینی درجهبندی کرد.
با این حال، معیار در یک لحظه مشخص به دست میآید. اکنون یک آزمایشگاه مرزی آن را در یک کارت مدل ذکر میکند، نسخههای نمایشی راهاندازی لوازم الکترونیکی را در صفحه اول قرار میدهد، و امتیاز برتر - 61.6٪ - نشان میدهد که مدلها به طور معناداری توانمند هستند در حالی که از قابل اعتماد بودن فاصله دارند. برای مهندسان برقی که در حال تماشا هستند، پیام اولین نتایج EEBench اندازهگیری میشود: هوش مصنوعی میتواند به طور فزایندهای مدارها را روی کاغذ طراحی کند. اینکه آیا آنها از تماس با قطعات واقعی جان سالم به در میبرند، دقیقاً همان چیزی است که این معیار برای کشف وجود دارد.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →