כאשר OpenAI חשפה השבוע את GPT-6 Astra, הדגמה אחת משכה תשומת לב מיוחדת מקהל שרק לעתים רחוקות זוכה לצעקה בהשקות דגמי חזית: מהנדסי חשמל. פוסט ההשקה הציג את הדגם המעצב לוח מעגלים ב-KiCad, כלי עיצוב אלקטרוניקה בקוד פתוח. אבל צוות קטן של מהנדסים שאל שאלה קשה יותר - לא האם דגמי AI יכולים להפעיל תוכנת אלקטרוניקה, אלא האם המעגלים שהם מייצרים אכן עובדים.

התשובה שלהם הגיעה ב-4 בספטמבר בצורה של EEBench, אמת מידה ציבורית חדשה שמדרגת מעגלים שתוכננו בינה מלאכותית תוך שימוש בהדמיות SPICE דטרמיניסטיות ולא בשיפוט אנושי. התוצאות המוקדמות מצביעות על כך שדגמים נוכחיים יודעים הרבה יותר על אלקטרוניקה ממה שהתפוקה שלהם מראה בדרך כלל, אך עדיין נכשלים בסוג של התנהגות חלקים בעולם האמיתי שמכשיל גם מהנדסי אנוש. For more context on this story, see our ongoing more AI stories.

מדוע עיצוב מעגלים זקוק למדד משלו

צוות EEBench, שמפרסם את המדד ב-eebench.org, אומר שהניסיון שלו מראה שהמודלים הנוכחיים ספגו ספרי לימוד, גליונות נתונים, הערות יישומים וכמויות אדירות של קוד. צוואר הבקבוק הוא הממשק. כאשר סוכן מפעיל כלי CAD גרפי כמו KiCad, הוא משקיע הרבה מהמאמץ שלו בלחיצה על תפריטים ומעקב אחר מה שמופיע על המסך, תוך שימוש בחלון ההקשר שלו עם קואורדינטות ומצב יישום במקום חשיבה חשמלית.

EEBench נוקט בגישה אחרת. מעגלים ב-benchmark כתובים באטופיל, שפה שמתארת ​​אלקטרוניקה כקוד הצהרתי, כך שהסוכן עובד ישירות על רכיבים, חיבורים ואילוצים. המודל יכול לשנות עיצוב, לבנות אותו, להריץ סימולציה ולבדוק כשלים מבלי לעזוב את הפרויקט. לדברי הצוות, זה עובד הרבה יותר מאשר לבקש ממודל לשרטט קווים ב-GUI - וזה מאפשר למבחן הבחינה של הידע האלקטרוניקה במקום מיומנות השימוש במחשב.

חלקים אמיתיים, כשלים אמיתיים

משימה ציבורית אחת נלקחת ממד אנרגיה למגורים. כאשר אספקת ה-5 וולט שלו נעלמת, המעגל חייב לשמור על המעבד בחיים למשך 20 מילישניות נוספות כדי שיוכל לחסוך קריאות מצטברות, כשהמסילה המוגנת נשארת מעל סף החום של 3.0 וולט של המעבד כל הזמן.

רוב הדגמים, מדווח הצוות, מגיעים מיד למסקנה הבסיסית הנכונה: הוסף קבל. המדד עושה את זה קשה יותר ממה שזה נשמע. קבל קרמי אמיתי עשוי לספק הרבה פחות מהקיבול המפורסם שלו ברגע שמופעל עליו מתח, חלקים נושאים סובלנות, וקיבול נוסף מוסיף עלות, תופס מקום ומאט את הטעינה מחדש של המסילה כאשר הכוח חוזר.

תלמידי הכיתה תפסו הגשה אחת שממחישה את הפער בין תשובות ספרי הלימוד לחומרה עובדת. עיצוב ציין 22 מיקרופארד נומינלית - ערך שנראה מספיק על הנייר. אבל ב-4.7 וולט של הטיה, המדרג מדד רק 11.4 מיקרו-פארד של קיבולת אפקטיבית, הרבה מתחת לדרישת המשימה של 545 מיקרו-פארד. קוד המקור נבנה בהצלחה. המעגל עדיין נכשל: הדמיה הראתה שהמסילה המוגנת יורדת מתחת לדרישת ה-3 וולט לאחר 0.85 מילישניות בלבד, לא מתקרבת ל-20 הנדרשים.

משימות קשות יותר דוחפות הלאה. הקצאה אנלוגית אחת מחייבת סינתזה של מסנן נמוך משוב מרובה סביב מגבר הפעלה, פתרון יחסי נגד וקבלים עבור הקטבים הנדרשים, ושמירה על הגבר, תדר החיתוך ו-Q בגבולות גם כאשר כל רכיב נדחף לפינות סובלנות מהמקרה הגרוע ביותר.

איך עובד הדירוג

בדיקות EEBench הן דטרמיניסטיות לחלוטין. הרתמה בונה את העיצוב שהוגש, בונה את גרף המעגלים ואת כתב החומרים, ומריצה סט של סימולציות SPICE ובדיקות עיצוב, כאשר כל דרישה מייצרת מדידה מול מגבלה מספרית. משימות מודדות רווח, סף, אדוות, תגובה חולפת והתנהגות בפינות סובלנות לרכיבים. הציון הטכני משולב עם מדד עלות-תועלת מול כתב עזר של חומרים - אם כי העלות עוזרת רק ברגע שהמעגל עובד.

הצוות משווה את ההגדרה לתת לסוכן קידוד מהדר וחבילת בדיקה, למעט הבדיקות מודדות מתחים והתנהגות רכיבים. כל המשימות בגרסה 1 משתמשות בחלקי יצרן אמיתיים, עם מפרטים המופקים מגיליונות נתונים ומועברים למודלים של סימולציה, מה שמאלץ את הסוכן למצוא שילובים שקיימים, ניתנים להזמנה ובמחיר סביר.

ה-Leaderboard הראשון

תוצאות מה-1 בספטמבר הציבו את קלוד אופוס 5 בראש EEBench V1 עם 61.6% על פני 13 משימות. גרוק 4.6 הגיע למקום השני עם 57.1%, רק לפני קלוד פייבל 5.1 עם 56.4%. קלוד פייבל 5 קלע 54.3% וקלוד אופוס 4.8 מקסימום 51.4%. הצוות מציין שלפני כמה חודשים הוא לא היה מצפה שדגמים יצליחו כך.

תוצאה אחת שימחה את הצוות במיוחד: xAI כללה את EEBench בכרטיס הדגם Grok 4.6, בסעיף על האצה הנדסית לצד מידול תלת מימד והערכות CAD פרמטריות. הריצה שפורסמה של xAI עצמה קיבלה ציון של Grok 4.6 ב-60.0% עם מאמץ חשיבה גבוה. על פי חומרי ההשקה של xAI, הדגם קיבל נתונים הנדסיים באיכות גבוהה והכשרת למידה חיזוק בסביבות ספציפיות לתחום, כולל עיצוב בעזרת מחשב.

הדגמים של OpenAI שנבדקו עד כה יושבים בהמשך הטבלה: GPT-5.5 קיבל ציון של 42.3% ו-GPT-5.6 Sol 39.4%. אין עדיין תוצאה של GPT-6 Astra - פער בולט בהתחשב בכך שהדגמת KiCad של הדגם עוררה את תשומת הלב המחודשת. לוח המובילים, המתודולוגיה וחוקר התוצאות לדוגמה של המדד הם כולם ציבוריים, ומעבדות יכולות להפעיל מודלים משלהן.

מה זה לא מודד - עדיין

EEBench V1 מכסה עיצוב אנלוגי ודיגיטלי באמצעות סימולציה בלבד. זה עדיין לא בודק אם דגם יכול לפרוס לוח פיזי, לייצר אותו או להעלות מוצר מוגמר - שלבים שבהם מופיעים מצבי כשל חדשים לגמרי. הצוות אומר שהוא רוצה להוסיף את השלבים האלה מאוחר יותר, אבל התמקד בגרסה 1 בלולאת הדרישות-עיצוב-אימות כי שם כבר ניתן לדרג בצורה אובייקטיבית את העבודה ההנדסית המועילה.

ובכל זאת, המדד נוחת ברגע מובהק. מעבדת גבול מצטטת את זה כעת בכרטיס דגם, הדגמות השקות שמות את האלקטרוניקה בעמוד הראשון, והציון העליון - 61.6% - מראה שדגמים מקבלים יכולת משמעותית תוך שהם רחוקים מלהיות אמינים. עבור מהנדסי החשמל שצופים, המסר מתוצאות EEBench הראשונות נמדד: AI יכול לעצב יותר ויותר מעגלים על נייר. האם הם שורדים מגע עם חלקים אמיתיים זה בדיוק מה שקיים רף זה כדי לגלות.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →