عندما كشفت شركة OpenAI النقاب عن GPT-6 Astra هذا الأسبوع، لفت أحد العروض التوضيحية انتباهًا خاصًا من الجمهور الذي نادرًا ما يحظى بالثناء عند إطلاق النماذج الرائدة: المهندسين الكهربائيين. أظهر منشور الإطلاق النموذج الذي يصمم لوحة دوائر كهربائية في KiCad، أداة تصميم الإلكترونيات مفتوحة المصدر. لكن فريقًا صغيرًا من المهندسين يطرح سؤالًا أصعب، ليس ما إذا كانت نماذج الذكاء الاصطناعي قادرة على تشغيل برامج الإلكترونيات، ولكن ما إذا كانت الدوائر التي تنتجها تعمل بالفعل.
وصلت إجابتهم في 4 سبتمبر في شكل EBench، وهو معيار عام جديد يقوم بتصنيف الدوائر المصممة بواسطة الذكاء الاصطناعي باستخدام محاكاة SPICE الحتمية بدلاً من الحكم البشري. تشير النتائج الأولية إلى أن النماذج الحالية تعرف عن الإلكترونيات أكثر بكثير مما تظهره مخرجاتها عادةً، ومع ذلك لا تزال تفشل في هذا النوع من السلوك الجزئي في العالم الحقيقي الذي يتعثر المهندسين البشريين أيضًا. لمزيد من السياق حول هذه القصة، راجع أحدث تطورات الذكاء الاصطناعي.
لماذا يحتاج تصميم الدوائر إلى معيار خاص به
يقول فريق EBench، الذي ينشر المعيار على موقع eebench.org، إن تجربته تظهر أن النماذج الحالية قد استوعبت الكتب المدرسية، وأوراق البيانات، وملاحظات التطبيق، وكميات هائلة من التعليمات البرمجية. عنق الزجاجة هو الواجهة. عندما يقوم الوكيل بتشغيل أداة CAD رسومية مثل KiCad، فإنه ينفق الكثير من جهده في النقر عبر القوائم وتتبع ما هو موجود على الشاشة، مستهلكًا نافذة السياق الخاصة به مع الإحداثيات وحالة التطبيق بدلاً من التفكير الكهربائي.
يأخذ EBench نهجا مختلفا. تتم كتابة الدوائر في المعيار بلغة الأتوبيل، وهي لغة تصف الإلكترونيات بأنها رمز تعريفي، لذلك يعمل الوكيل مباشرة على المكونات والاتصالات والقيود. يمكن للنموذج تعديل التصميم وبنائه وتشغيل المحاكاة وفحص حالات الفشل دون مغادرة المشروع. وفقًا للفريق، فإن هذا يعمل بشكل أفضل بكثير من مطالبة النموذج برسم خطوط في واجهة المستخدم الرسومية - ويتيح للمعيار اختبار المعرفة الإلكترونية بدلاً من مهارة استخدام الكمبيوتر.
أجزاء حقيقية، إخفاقات حقيقية
يتم استخلاص مهمة عامة واحدة من عداد الطاقة السكني. عندما يختفي مصدر 5 فولت، يجب أن تبقي الدائرة المعالج على قيد الحياة لمدة 20 مللي ثانية أخرى حتى يتمكن من حفظ القراءات المتراكمة، مع بقاء السكة المحمية أعلى من عتبة انقطاع التيار الكهربائي البالغة 3.0 فولت للمعالج طوال الوقت.
يفيد الفريق أن معظم النماذج تصل فورًا إلى النتيجة الأساسية الصحيحة: إضافة مكثف. المعيار يجعل ذلك أصعب مما يبدو. قد يقدم مكثف سيراميكي حقيقي أقل بكثير من سعته المعلن عنها بمجرد تطبيق الجهد الكهربي عبره، وتحمل الأجزاء تفاوتات، وتضيف السعة الإضافية تكلفة، وتأخذ مساحة، وتبطئ إعادة شحن السكة عندما تعود الطاقة.
اكتشف طلاب الصف واجبًا واحدًا يوضح الفجوة بين إجابات الكتب المدرسية وأجهزة العمل. وقد حدد التصميم 22 ميكروفاراد اسميًا، وهي قيمة تبدو كافية على الورق. ولكن عند 4.7 فولت من الانحياز، قامت الممهدة بقياس 11.4 ميكروفاراد فقط من السعة الفعالة، وهو أقل بكثير من متطلبات المهمة البالغة 545 ميكروفاراد. تم بناء الكود المصدري بنجاح. لا تزال الدائرة فاشلة: أظهرت المحاكاة أن السكة المحمية تنخفض إلى أقل من متطلبات 3 فولت بعد 0.85 مللي ثانية فقط، وهي ليست قريبة من 20 مللي ثانية المطلوبة.
المهام الصعبة تدفع إلى أبعد من ذلك. تتطلب إحدى المهام التناظرية تصنيع مرشح تمرير منخفض متعدد ردود الفعل حول مضخم تشغيلي، وحل نسب المقاوم والمكثف للأقطاب المطلوبة، والحفاظ على الكسب وتردد القطع وQ ضمن الحدود حتى عندما يتم دفع كل مكون إلى زوايا التسامح في أسوأ الحالات.
كيف يعمل التصنيف
تعتبر فحوصات EBench حتمية تمامًا. يقوم الحزام ببناء التصميم المقدم، وإنشاء الرسم البياني للدائرة وقائمة المواد، وتشغيل مجموعة من عمليات محاكاة SPICE وفحوصات التصميم، حيث ينتج كل متطلب قياسًا مقابل حد رقمي. تقيس المهام الكسب والعتبات والتموج والاستجابة العابرة والسلوك في زوايا التسامح مع المكونات. يتم دمج النتيجة الفنية مع مقياس فعالية التكلفة مقابل فاتورة مرجعية للمواد - على الرغم من أن التكلفة تساعد فقط عندما تعمل الدائرة.
يقارن الفريق الإعداد بإعطاء وكيل التشفير مترجمًا ومجموعة اختبار، باستثناء الاختبارات التي تقيس الفولتية وسلوك المكونات. تستخدم جميع المهام في الإصدار 1 أجزاء حقيقية من المصنع، مع المواصفات المستخرجة من أوراق البيانات ويتم نقلها إلى نماذج المحاكاة، مما يجبر الوكيل على العثور على مجموعات موجودة، ويمكن طلبها، وبأسعار معقولة.
لوحة المتصدرين الأولى
وضعت النتائج من 1 سبتمبر Claude Opus 5 في قمة EBench V1 بنسبة 61.6% في 13 مهمة. وجاء Grok 4.6 في المركز الثاني بنسبة 57.1%، متقدماً مباشرة على Claude Fable 5.1 بنسبة 56.4%. حصل كلود فابل 5 على 54.3% وكلود أوبوس 4.8 ماكس 51.4%. ويشير الفريق إلى أنه قبل بضعة أشهر لم يكن يتوقع أن تؤدي النماذج هذا الأداء الجيد.
إحدى النتائج أسعدت الفريق بشكل خاص: قامت xAI بتضمين EBench في بطاقة نموذج Grok 4.6، في قسم خاص بالتسريع الهندسي جنبًا إلى جنب مع النمذجة ثلاثية الأبعاد وتقييمات CAD البارامترية. سجل التشغيل المنشور لـ xAI درجة Grok 4.6 بنسبة 60.0% بجهد استدلالي عالي. وفقًا لمواد إطلاق xAI، تلقى النموذج بيانات هندسية عالية الجودة وتدريبًا على التعلم المعزز في بيئات خاصة بالمجال، بما في ذلك التصميم بمساعدة الكمبيوتر.
نماذج OpenAI التي تم اختبارها حتى الآن تقع في أسفل الجدول: سجل GPT-5.5 42.3% وGPT-5.6 Sol 39.4%. لا توجد نتيجة لـ GPT-6 Astra حتى الآن، وهي فجوة ملحوظة نظرًا لأن العرض التوضيحي للنموذج KiCad أثار الاهتمام المتجدد. إن لوحة المتصدرين والمنهجية ومستكشف نتائج العينات الخاصة بالمعيار كلها عامة، ويمكن للمختبرات تشغيل نماذجها الخاصة.
ما لا يمكن قياسه - حتى الآن
يغطي EBench V1 التصميم التناظري والرقمي من خلال المحاكاة فقط. وهي لم تختبر بعد ما إذا كان النموذج يمكنه وضع لوحة مادية، أو تصنيعها، أو طرح منتج نهائي - وهي مراحل تظهر فيها أنماط فشل جديدة تمامًا. يقول الفريق إنه يريد إضافة تلك المراحل لاحقًا، لكنه ركز الإصدار 1 على حلقة التحقق من المتطلبات والتصميم، لأن هذا هو المكان الذي يمكن فيه بالفعل تصنيف العمل الهندسي المفيد بشكل موضوعي.
ومع ذلك، فإن المؤشر يهبط في لحظة حاسمة. يستشهد أحد المختبرات الحدودية الآن بذلك في بطاقة نموذجية، وتضع العروض التوضيحية التي يتم إطلاقها الإلكترونيات على الصفحة الأولى، وتظهر النتيجة الأعلى - 61.6% - أن النماذج أصبحت قادرة بشكل هادف بينما تظل بعيدة عن الموثوقية. بالنسبة للمهندسين الكهربائيين الذين يشاهدون، يتم قياس الرسالة من نتائج EBench الأولى: يمكن للذكاء الاصطناعي تصميم الدوائر بشكل متزايد على الورق. ما إذا كانوا ينجون من الاتصال بأجزاء حقيقية هو بالضبط ما يجب أن يكتشفه هذا المعيار.
---
ابق على اطلاع بأخبار الذكاء الاصطناعيآخر أخبار وتحليلات وإنجازات الذكاء الاصطناعي — في مكان واحد.
اقرأ المزيد من أخبار الذكاء الاصطناعي →