Cerebras הסירה את המעטפת מה-CS-4, מערכת הסקת AI בקנה מידה מתלים שנבנתה סביב המעבד החדש שלה בקנה מידה של WSE-3 Turbo, בטענה שהמכונה מספקת הסקה מהירה של עד פי 30 ממערכות מבוססות GPU, שכן החברה מציבה את עצמה כאלטרנטיבה למהירות לאימפריית מרכז הנתונים של Nvidia.
ההשקה, שהוכרזה ביום שלישי ומפורטת על פני דפי המוצר של החברה וגל סיקור מרויטרס, בלומברג ו-The Register, מסמנת את רענון החומרה המשמעותי ביותר של Cerebras מאז יציאתה להנפקה - ורגע מרכזי עבור חברה שמנייתה נאבקה מאז הנפקתה. נראה שהמשקיעים שמים לב: מניות Cerebras (CBRS) זינקו בחדשות, וה-Investor's Business Daily ציטט את פרשנות המנכ"ל ששוק ההסקת AI "צומח כל כך מהר".
לקוראים שעוקבים אחר המירוץ המואץ לגרום לדגמי בינה מלאכותית להגיב מהר יותר, השקת CS-4 היא אחד מסיפורי החומרה המשמעותיים ביותר ברבעון, והיא נוחתת על רקע שינויים רחבים יותר בכיסוי תעשיית הבינה המלאכותית שממשיכים לעצב מחדש את נוף המחשוב.
מה יש בתוך ה-CS-4
מרכיב הכותרת הוא ה-WSE-3 Turbo, גרסה משודרגת של מנוע בגודל של צלחת ארוחת ערב של Cerebras. על פי הצלילה הטכנית לעומקה של The Register, ה-WSE-3T אינו סיליקון חדש - הוא שומר על אותו תהליך TSMC 5nm, שטח קוביות של 46,225 מילימטר רבוע, 4 טריליון טרנזיסטורים, 900,000 ליבות ו-44 GB של SRAM על רקיק כמו ה-WSE-3 בן השנתיים.
במקום זאת, Cerebras השיגה את הכפלת הביצועים שלה על ידי דחיפה של השבב הקיים הרבה יותר חזק. ה-WSE-3T מכפיל את מחשוב ה-FP16 הדליל ל-250 petaFLOPS, מכפיל את ביצועי ה-FP16 הצפופים ל-25 petaFLOPS, מכפיל את רוחב הפס של הזיכרון ל-43.2 פטה-בייט לשנייה, ומכפיל את רוחב הפס הקלט/פלט ל-2.4 טרה-ביט לשנייה. ה-Register מעריך שהחברה מעידה כעת על הסיליקון במהירות של כ-2.8 גיגה-הרץ, לעומת כ-1.4 גיגה-הרץ בדור הקודם.
הטריק, לפי Cerebras, הוא מערכת אספקת חשמל מעוצבת מחדש, הממוקמת במרחק של 0.5 מילימטר בלבד מהמעבד - קרוב פי 100 בערך מ-50 המילימטרים האופייניים ללוחות GPU רגילים. הקרבה הזו כמעט מבטלת את אובדן הכוח ברמת הלוח ומאפשרת פי שניים כוח להגיע לפרוסה, מה שמאפשר את תדרי ההפעלה הגבוהים יותר מאחורי יצירת אסימון מהיר יותר.
ארכיטקטורת ה-Nexus Rack
מעבר לשבב עצמו, ה-CS-4 מציג את מה ש-Cerebras מכנה ארכיטקטורת הפלטפורמה של Nexus, העיצוב האמיתי הראשון שלו בקנה מידה מתלים ומענה ישיר למערכות המדף של Nvidia NVL72 ו- Helios של AMD. כל CS-4 יכול לשאת עד שלושה מעבדי WSE-3T הממוקמים בתוך "תרמילים בקנה מידה של Wafer" עצמאיים - חבילות תלת מימד המקפלות את הפרוסה, המרת הספק, קירור נוזלים ישיר, קלט/פלט מהיר ובקרה אלקטרונית למכלול אחד עם 50% פחות רכיבים.
העיצוב המודולרי מפריד בין שכבת ההספק, הקירור והרשת היציבה לבין המחשוב. ניתן להתקין Cerebras PowerRack ולהתאים למתקן לפני שמגיע כל מחשב, ואז התרמילים גולשים למקומם - מה שמפחית את זמן הפריסה מימים לשעות, לדברי החברה.
צריכת החשמל היא משמעותית. ה-Register מעריך בסביבות 46 קילוואט לתרמיל ותיק גב של מערכת הכוללת של 120 עד 140 קילוואט - מספרים מושכי עין שלמרות זאת נראים שמרניים לצד מערכות המדף של 240 עד 250 קילוואט AMD ו-Nvidia צפויות להישלח בהמשך השנה.
להרוג את המתג
אולי הבחירה המעניינת ביותר מבחינה טכנית היא החיבור. במקום לנתב תעבורת רקיק ל-wafer דרך מתגים - הגישה ש-AWS אימצה עבור מאיצי ה-Trainium3 שלה - Cerebras מחברת את השבבים שלה לטופולוגיית טורוס דו-ממדית שבה פרוסים שכנים מדברים ישירות אחד עם השני. העיצוב מקצץ את זמן ההשהיה של רקיק ל-wafer מחמש מיקרו-שניות לשתיים בלבד, ו-Cerebras אומר שהרשת יכולה לתמוך בדגמים של עד 50 טריליון פרמטרים, בנוחות מעבר לכל מה שקיים כרגע.
תוצאות המהירות מרשימות. במערכת CS-4 יחידה, חברת ההשוואה Artificial Analysis מדדה עד 4,400 אסימונים לשנייה למשתמש ב-gpt-oss-120b - בערך פי 12 מ-350 אסימונים לשנייה משירותי ההסקה המהירים ביותר מבוססי GPU הזמינים כיום. Cerebras טוענת גם שהמערכת מחזיקה יותר מ-1,000 אסימונים לשנייה בדגמים שעולים על 10 טריליון פרמטרים.
אסטרטגיית שותפות מפורקת
יש לציין ש-Cerebras כבר לא מנסה להפעיל את כל צינור ההסקה על הסיליקון שלה. החברה שיתפה פעולה עם AWS ו-AMD כדי להוריד את שלב עיבוד ההנחות עתיר המחשוב של ההסקה אל ה-Trainium XPUs ו-Instinct GPUs בהתאמה, מה שמותיר את המנועים שלה בקנה מידה רקיק להתמודד עם שלב הפענוח הרגיש להשהיה שבו מאגרי ה-SRAM האדירים שלהם זוהרים.
השקת CS-4 מרחיבה גם את שיתוף הפעולה של Cerebras עם OpenAI. Yahoo Finance דיווחה על החשיפה לצד שותפויות חדשות של OpenAI ו-AMD שמטרתן להאיץ את הסקת הבינה המלאכותית - בהתבסס על מצב ה-Ultrafast שהחברות הציגו מוקדם יותר באוגוסט, שהביא את GPT-5.6 Sol למשתמשים בקצב של עד 750 אסימונים לשנייה.
אזהרות מאחורי מספרי הכותרות
אנליסטים בתעשייה קוראים להיזהר בנתוני השיווק. ה-Register מציין שהכותרת 250 petaFLOPS של Cerebras מסתמכת על דלילות, שבדרך כלל אינה מועילה להסקת מודלים גדולים של שפה, וכי נתוני שיא רוחב הפס של הזיכרון הם בעיקרם תיאורטיים מכיוון של-WSE-3 היה חסר את המחשוב להרוות את ה-SRAM שלו. הפרסום גם שאל מדוע Cerebras הכפילה את הביצועים במקום להגדיל את קיבולת ה-SRAM, שלא גדלה בצורה משמעותית מאז הושק ה-WSE-2 לפני חמש שנים - בחירה מוזרה בעידן של מסקנות מפורקות שבה מאיצי פענוח מרוויחים הכי הרבה מהזיכרון.
ובכל זאת, ההזדמנות בשוק היא אמיתית. מכיוון שצ'אטבוטים וסוכנים של AI דורשים זמני תגובה מהירים יותר, מהירות ההסקה הפכה למבדיל תחרותי אמיתי, ו-Cerebras הוכיחה כעת שהיא יכולה לחזור על הטכנולוגיה הלא קונבנציונלית שלה בקנה מידה רקיק על קצב מסחרי.
משלוחי ה-CS-4 הראשונים מתחילים ברבעון זה, כאשר המערכות הראשונות צפויות להיות מקוונות לפני סוף ספטמבר. אם זה מספיק כדי לפגוע בדומיננטיות של Nvidia נותר לראות - אבל לראשונה מזה זמן מה, להסקת הבינה המלאכותית המהירה ביותר בתעשייה יש כתובת חדשה.
הישאר לפני AI
השקות חומרה כמו CS-4 מזיזות שווקים ומגדירות מחדש את מה שמערכות AI יכולות לעשות. קרא עוד חדשות AI כדי להתעדכן בכל התפתחות.
גלה את הסיקור האחרון של AI →