חברת ה-AI האירופית Multiverse Computing השיקה את Quasar 438B, מודל חשיבה גדול שלדבריה הוא דגם ה-AI החכם ביותר שנבנה באירופה. על פי הודעת החברה, Quasar 438B מקבל ציון 43 במדד האינטליגנציה המלאכותית, התוצאה הגבוהה ביותר מכל מודל אירופי שנמדד על מדד זה.
ההשקה מסמנת צעד משמעותי עבור החברה הספרדית, שבנתה את המוניטין שלה על דחיסת מודל AI במקום אימון מערכות בקנה מידה גבול. Quasar 438B הוא הדגם הגדול הראשון שפרסמה Multiverse Computing, והוא מגיע כאשר ממשלות וחברות אירופיות דוחפות ליכולת AI שאינה תלויה לחלוטין במעבדות אמריקאיות וסיניות. לקוראים שעוקבים אחר סיקור החדשות שלנו בינה מלאכותית, המהדורה גם מסמנת שהמירוץ לסגירת הפער עם דגמי הגבול אינו מוגבל עוד למתמודדים הרגילים בארה"ב.
מה Quasar 438B קולע בפועל
אינדקס הבינה המלאכותית של אנליזה (גרסה 4.1.1) משלב תשע הערכות, כולל GDPval-AA v2, tau3-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience ו-AA-LCR. הציון המרוכב של Quasar 438B של 43 מעמיד אותו לפני Mistral Medium 3.5 ב-30, Nemotron 3 Ultra של NVIDIA ב-38, ו-Inkling ב-42, לפי הודעת החברה.
התחום הרחב יותר עדיין שייך לגבול האמריקאי: קלוד אופוס 5 מוביל את המדד ב-63. Multiverse Computing אינו טוען אחרת. במקום זאת, החברה מסגרה את Quasar 438B כאופציה האירופית החזקה ביותר, תוך ביצועים טובים יותר מדגמים אירופיים דומים בשבע מתוך שמונה הערכות הניתוח המלאכותי שנבחרו שהדגישה.
מהירות היא הטיעון השני
ציוני אמת מידה גולמיים הם רק מחצית מהמגרש של Multiverse Computing. החברה אומרת ש-Quasar 438B מחזיר 500 אסימונים, כולל זמן חשיבה, תוך 15.3 שניות. בין הדגמים בהשוואה שלו, רק Nemotron 3.5 Lightning (9.4 שניות), Gemini 3.5 Flash-Lite (10.8 שניות) ו-Gemini 3.7 Flash (11.5 שניות) מהירים יותר, ורק Gemini 3.7 Flash הוא גם מהיר יותר וגם מסוגל יותר במדד.
ההשוואה מול מיסטרל מדיום 3.5 פועלת בכיוון אחד בשני הצירים: קוואזר מקבל ציונים גבוהים יותר (43 מול 30) ועונה מהר יותר (15.3 שניות מול 18.8 שניות). Inkling, שכמעט תואם את האינטליגנציה של Quasar בגיל 42, זקוק ל-48.3 שניות לאותה תגובה של 500 אסימונים, יותר מפי שלושה יותר.
נימוק חזק עם הקשר ארוך
תוצאה אחת בולטת מההכרזה: ב-AA-LCR, ההערכה הבודקת את היכולת לחלץ, להתחבר ולהניב על מידע המפוזר על פני מסמכים ארוכים, Quasar 438B מקבל ציון של 75.0. זה ברמה של גרוק 4.6 (גבוה), בנקודה של קלוד אופוס 5 ב-75.7, ולפני Qwen3.8 2.4T A95B ב-75.3, לפי נתוני החברה.
טיפול ארוך-הקשר חשוב מכיוון שמחקר ארגוני, ניתוח מסמכים וזרימות עבודה סוכניות בנויים עליו. אם מודל אינו יכול להחזיק ולחבר מידע על פני מסמך ארוך, הוא לא יכול להפעיל את הכלים הרב-שלביים שחברות באמת רוצות לפרוס. זה המקום שבו Quasar מתקרב הכי הרבה לקבוצת הגבול.
לקידוד סוכן עדיין יש מרווח ראש
התוצאה החלשה ביותר בהכרזה היא Terminal-Bench v2.1, שמכניסה סוכני קידוד לעבודה בסביבות טרמינלים אמיתיות. Quasar 438B משיג 69.3, מוביל את מיסטרל בינוני 3.5 ב-18.7 נקודות ואת נמוטרון 3 אולטרה ב-15.4, אך בפיגור של קבוצת הגבול בראשות קלוד אופוס 5 ב-89.1. Multiverse Computing מכיר בכך שזו ההערכה עם מרווח הראש הרב ביותר ואומר שסבב העבודה הבא מכוון אליה.
נבנה עבור סוכנים ארגוניים
Quasar 438B ממוקם כמודל עבור ארגונים המפעילים סוכני פיתוח תוכנה, טייסי שיתוף טכניים, מערכות מחקר ואוטומציה של זרימת עבודה. הוא יושב במחלקה של 400 מיליארד פרמטרים פלוס, מטפל באנגלית ובספרדית, ונועד למשימות מרובות שלבים שצריכות תכנון, שימוש בכלים, ביצוע קוד והקשר גדול ללא השהיה שהכיתה נושאת בדרך כלל.
הגישה פועלת דרך ה-API CompactifAI של החברה, כך שצוותים יכולים לבדוק את המודל מבלי לעמוד על התשתית שלהם. Multiverse Computing אומר שעדכונים נוספים עבור Quasar מגיעים.
מה זה אומר עבור מרוץ הבינה המלאכותית האירופי
המהדורה נוחתת ברגע מוזר עבור AI אירופי. מיסטרל, זמן רב נושאת הדגל של היבשת, התמודדה עם שאלות לגבי הכיוון שלה, בעוד שמעבדות ארה"ב איחדו את ההובלה שלהן במדדים מורכבים. מודל אירופי שמוביל באופן לגיטימי את התחום האירופי במדד עצמאי נותן למפעלים ביבשת אפשרות אזורית אמינה, במיוחד לפריסות דו-לשוניות אנגלית-ספרדית.
האם Quasar 438B מחזיק בתפקיד זה הוא עניין אחר. החברה עצמה מציינת שרק חלק ממובילי המדדים עונים מהר יותר, והפער לקלוד אופוס 5 נותר ברוחב של עשרים נקודות. אבל חברת הדחיסה הראשונה הראתה כעת שהיא יכולה להתחרות במעמד המשקל הכבד, ולחברות אירופיות יש סוף סוף מודל של שוק ביתי ששווה לבדוק מול ברירות המחדל שלהם בארה"ב.
הישאר לפני AI
נוף הבינה המלאכותית משתנה לפי שעה, והפניות בנצ'מרק שנראו בלתי ניתנות לערעור בינואר נעלמו עד הקיץ. קרא עוד חדשות בינה מלאכותית על AI Buzz Wire כדי לעקוב אחר כל שחרור דגם, תוצאות ביצועים ושינוי מדיניות בזמן שהוא מתרחש.
עקוב אחר ההתפתחויות האחרונות בינה מלאכותית כאן.