Cerebras Systems ו-OpenAI שיתפו הצצה מוקדמת ל-Ultrafast Mode, שכבת שירות חדשה שהושקה לראשונה ב-OpenAI API ומופעלת על ידי טכנולוגיית Cerebras בקנה מידה פרוסות. השותפות מאפשרת ל-GPT-5.6 Sol לפעול בקצב של עד 750 אסימוני פלט בשנייה, ולספק מודיעין ברמת גבול במהירויות בזמן אמת. לחדשות העדכניות ביותר על חומרת AI, בקר ב-AI Buzz Wire.

ביטול הפשרה בין מהירות מודיעין

בוני בינה מלאכותית ניצבו מזמן בפני פשרות מהותי: ככל שהדגמים מתרחבים בגודל ובאינטליגנציה, הם כרוכים בעלויות חישוביות והעברת נתונים גבוהות יותר, ומאטות את זמני התגובה. מפתחים נאלצו לבחור בין המתנה לתוצאות באיכות גבוהה או קבלת תוצאות נחותות בפחות זמן.

GPT-5.6 Sol on Ultrafast Mode נועד לפתור את הדילמה הזו. לפי Cerebras, השירות פועל פי 11 מהר יותר מ-Claude Fable 5 של Anthropic ופי 5 מהר יותר מ-Opus 4.8 במצב מהיר, בהתבסס על מהירויות פלט שדווחו על ידי ניתוח מלאכותי.

הבחינה האחרונה של האנושות: מבחן המהירות

Cerebras העמידה את Ultrafast במבחן מול מודלים מתחרים בבחינה האחרונה של האנושות (HLE), אמת מידה מאתגרת המורכבת מ-2,500 שאלות שעליהן לענות בדרך כלל רק על ידי בעלי דוקטורט בתחומים כמו כימיה, כלכלה וספרות.

בהערכות שערכה Cerebras, GPT-5.6 Sol במצב אולטרה-מהיר ענה על כל 2,500 שאלות HLE תוך 11 שעות ו-11 דקות. קלוד פייבל 5 דרש 78 שעות ו-27 דקות, יותר משלושה ימים של חישוב רציף, כדי להגיע לאותן מסקנות. במילים אחרות, Ultrafast עיבד את גבול הידע האנושי ביום עבודה אחד, והשיג דיוק דומה כמעט פי שבעה מהר יותר.

Benchmarking בוצע על ידי Cerebras באמצעות GPT-5.6 Sol Ultrafast עם Codex על הגדרות נימוק גבוהות ב-10 ביולי, ו-Claude Fable 5 עם Claude Code על הגדרות הגיון גבוהות מ-13 עד 15 ביולי.

השפעה עסקית בעולם האמיתי

ב-GDP-Val, אמת מידה למשימות עבודת ידע בעלות ערך כלכלי, Ultrafast סיפקה מהירות של פי 5.6 מקצה לקצה ללא ירידה באיכות. זה מדגים כיצד הסקה מהירה יותר יכולה להאיץ עבודה בעלת ערך כלכלי מבלי להקריב את איכות הפלט.

Cerebras רואה את Ultrafast ככלי לתרחישים שבהם כל שנייה חשובה. חברות המפעילות שירותי אינטרנט יכולות להשתמש בטכנולוגיה כדי לגרום לשורש ולטפל בהפסקות ייצור מהר יותר, לשמר את אמון הלקוחות ולמנוע אובדן הכנסה. במצבי אבטחת סייבר עם סיכון גבוה, צוותי אבטחה יכולים למנף את Ultrafast כדי לזהות ולהגיב להתקפות במהירות.

הטכנולוגיה שמאחורי המהירות

היתרון בביצועים נובע מארכיטקטורת Wafer-Scale Engine של Cerebras, אשר נבנתה ייעודית לעומסי עבודה של בינה מלאכותית. אתגר הליבה של הסקת גבולות מהירה הוא בעיית תנועת נתונים: במעבדי GPU מסורתיים, ההסקה על דגמים גדולים היא צווארי בקבוק על ידי רוחב הפס של הזיכרון, שכן משקלי הדגם חייבים לעבור שוב ושוב בין זיכרון שבשבב לאחסון מחוץ לשבב כדי ליצור אסימונים עוקבים.

Cerebras נוקט בגישה שונה מהותית. כל שבב בגודל רקיק מכיל 44 GB של SRAM ישירות על הסיליקון. משקולות הדגם נשארות על השבב, ואסימונים זורמים ללא הפרעה דרך שכבות הדגם המונחות בצנרת על פני פרוסות. זה מבטל את תנועת הנתונים הלא יעילה שמאטה מסקנות מבוססות GPU ומתרחבת בצורה חלקה עם גודל הדגם, וסוללת את הדרך ליתרון מהירות מתמשך בדגמי חזית עתידיים.

זמינות ומיצוב שוק

GPT-5.6 Sol במצב אולטרה-מהיר זמין כעת בתצוגה מקדימה מוגבלת לקבוצה נבחרת של לקוחות, כשהגישה מתרחבת עם הזמן ככל שהקיבולת גדלה. Cerebras מתאר את השותפות כמניעה את הגל הבא של חדשנות בינה מלאכותית והעלאת התקרה למה שארגונים יכולים להשיג עם AI רספונסיבי.

שיתוף הפעולה מהווה אבן דרך משמעותית עבור Cerebras, אשר רודפת זמן רב אחר מחשוב בקנה מידה רקיק כחלופה לשוק חומרת הבינה המלאכותית הנשלטת על ידי GPU. על ידי שיתוף פעולה ישיר עם OpenAI כדי להאיץ את אחד מדגמי הגבול המסוגלים ביותר הזמינים, Cerebras מציגה טענה חזקה שהארכיטקטורה שלה מציעה יתרון תחרותי אמיתי לעומסי עבודה מהירים.

ככל שהדגמים ממשיכים לגדול וחכמים יותר, היכולת לשרת אותם במהירויות בזמן אמת עלולה להפוך לגורם תחרותי מכונן בשוק תשתיות הבינה המלאכותית. השותפות Cerebras-OpenAI מאותתת שהמרוץ אחר מהירות ההסקה חשוב כעת כמו המירוץ לאינטליגנציה של מודלים.

הישאר לפני AI

לחדשות נוספות על חומרת בינה מלאכותית, ניתוח ביצועי מודל ופיתוחים בתעשייה, סימני AI Buzz Wire.

קרא עוד חדשות AI →