قامت Cerebras بإزالة الأغطية عن CS-4، وهو نظام استدلال AI على نطاق الرف مبني على معالج WSE-3 Turbo الجديد على نطاق الرقاقة، مدعيًا أن الجهاز يوفر استدلالًا أسرع بما يصل إلى 30 مرة من الأنظمة المستندة إلى GPU حيث تضع الشركة نفسها كبديل للسرعة لإمبراطورية مركز بيانات Nvidia.
يمثل الإطلاق، الذي تم الإعلان عنه يوم الثلاثاء وتم تفصيله عبر صفحات منتجات الشركة وموجة من التغطية من رويترز وبلومبرج وThe Register، أهم تحديث لأجهزة Cerebras منذ طرحها للاكتتاب العام - ولحظة محورية لشركة عانت أسهمها منذ الاكتتاب العام. يبدو أن المستثمرين ينتبهون: ارتفعت أسهم شركة Cerebras (CBRS) بعد الأخبار، ونقلت صحيفة Investor's Business Daily عن تعليق الرئيس التنفيذي بأن سوق استدلال الذكاء الاصطناعي "ينمو بسرعة كبيرة".
بالنسبة للقراء الذين يتتبعون السباق المتسارع لجعل نماذج الذكاء الاصطناعي تستجيب بشكل أسرع، يعد إطلاق CS-4 واحدًا من أكثر قصص الأجهزة أهمية في هذا الربع، ويأتي وسط تحولات أوسع في تغطية صناعة الذكاء الاصطناعي التي تستمر في إعادة تشكيل مشهد الحوسبة.
ماذا يوجد داخل CS-4
المكون الرئيسي هو WSE-3 Turbo، وهو نسخة مطورة من محرك الويفر بحجم طبق العشاء من Cerebras. وفقًا للغوص العميق الفني لـ The Register، فإن WSE-3T ليس سيليكونًا جديدًا - فهو يحتفظ بنفس عملية TSMC 5 نانومتر، ومساحة قالب تبلغ 46225 ملم مربع، و4 تريليون ترانزستور، و900000 نواة و44 جيجابايت من ذاكرة الوصول العشوائي على الرقاقة مثل WSE-3 البالغ من العمر عامين.
وبدلاً من ذلك، حققت شركة Cerebras مضاعفة الأداء من خلال دفع الشريحة الحالية بقوة أكبر. يضاعف WSE-3T حساب FP16 المتفرق إلى 250 بيتافلوب، ويضاعف أداء FP16 الكثيف إلى ما يقدر بـ 25 بيتافلوب، ويضاعف عرض النطاق الترددي للذاكرة إلى 43.2 بيتابايت في الثانية، ويضاعف عرض النطاق الترددي للإدخال/الإخراج إلى 2.4 تيرابايت في الثانية. ويقدر السجل أن الشركة تقوم الآن بتسجيل تردد السيليكون بسرعة 2.8 جيجا هرتز تقريبًا، ارتفاعًا من حوالي 1.4 جيجا هرتز في الجيل السابق.
الخدعة، وفقًا لـ Cerebras، هي نظام توصيل الطاقة المعاد تصميمه والذي يقع على بعد 0.5 ملم فقط من المعالج - وهو أقرب 100 مرة تقريبًا من ~ 50 ملم النموذجي للوحات GPU التقليدية. يؤدي هذا القرب إلى القضاء على فقدان الطاقة على مستوى اللوحة تقريبًا ويسمح بضعف الطاقة للوصول إلى الرقاقة، مما يتيح ترددات تشغيل أعلى وراء توليد رمزي أسرع.
بنية Nexus Rack
وبعيدًا عن الشريحة نفسها، يقدم CS-4 ما يسميه Cerebras بنية منصة Nexus، وهو أول تصميم حقيقي على نطاق الحامل وإجابة مباشرة على أنظمة الرفوف NVL72 من Nvidia وأنظمة الرف Helios من AMD. يمكن لكل CS-4 أن يحمل ما يصل إلى ثلاثة معالجات WSE-3T موجودة في "حقائب ظهر على نطاق الرقاقات" - حزم ثلاثية الأبعاد تعمل على طي الرقاقة وتحويل الطاقة والتبريد السائل المباشر والإدخال/الإخراج عالي السرعة وإلكترونيات التحكم في مجموعة واحدة بمكونات أقل بنسبة 50%.
يفصل التصميم المعياري بين طبقة الطاقة والتبريد والشبكة المستقرة والحوسبة. يمكن تثبيت Cerebras PowerRack وتأهيله للمنشأة قبل وصول أي حوسبة، ثم يتم وضع حقائب الظهر في مكانها - مما يقلل وقت النشر من أيام إلى ساعات، وفقًا للشركة.
استهلاك الطاقة كبير. يقدر السجل حوالي 46 كيلو واط لكل حقيبة ظهر وسحب إجمالي للنظام يتراوح من 120 إلى 140 كيلو واط - وهي أرقام ملفتة للنظر ومع ذلك تبدو متحفظة بجوار أنظمة الرفوف التي تتراوح من 240 إلى 250 كيلو واط والتي من المتوقع أن يتم شحنها AMD و Nvidia في وقت لاحق من هذا العام.
قتل التبديل
ربما يكون الخيار الأكثر إثارة للاهتمام من الناحية الفنية هو الاتصال البيني. بدلاً من توجيه حركة مرور الرقاقة إلى الرقاقة من خلال المحولات - وهو النهج الذي اعتمدته AWS لمسرعات Trainium3 الخاصة بها - تقوم Cerebras بتوصيل شرائحها إلى طوبولوجيا torus ثنائية الأبعاد حيث تتحدث الرقاقات المجاورة مباشرة مع بعضها البعض. يخفض التصميم زمن الوصول من الرقاقة إلى الرقاقة من خمسة ميكروثانية إلى اثنين فقط، ويقول سيريبراس إن الشبكة يمكن أن تدعم نماذج تصل إلى 50 تريليون معلمة، وهو ما يتجاوز بشكل مريح أي شيء موجود حاليًا.
نتائج السرعة مذهلة. على نظام CS-4 واحد، قامت شركة Artificial Analysis المرجعية بقياس ما يصل إلى 4400 رمزًا مميزًا في الثانية لكل مستخدم على gpt-oss-120b - ما يقرب من 12 ضعف ~ 350 رمزًا مميزًا في الثانية من أسرع خدمات الاستدلال المستندة إلى وحدة معالجة الرسومات المتاحة اليوم. تدعي Cerebras أيضًا أن النظام يدعم أكثر من 1000 رمز في الثانية على نماذج تتجاوز 10 تريليون معلمة.
استراتيجية الشراكة المفصلة
والجدير بالذكر أن Cerebras لم تعد تحاول تشغيل خط أنابيب الاستدلال بالكامل على السيليكون الخاص بها. دخلت الشركة في شراكة مع AWS وAMD لتفريغ مرحلة المعالجة السريعة للحوسبة المكثفة للاستدلال على وحدات معالجة الرسوميات Trainium XPUs وInstinct على التوالي، تاركة محركاتها على نطاق الرقاقة للتعامل مع مرحلة فك التشفير الحساسة لزمن الوصول حيث تتألق احتياطيات SRAM الضخمة الخاصة بها.
يعمل إطلاق CS-4 أيضًا على توسيع تعاون Cerebras مع OpenAI. أبلغت Yahoo Finance عن كشف النقاب عن شراكات OpenAI وAMD الجديدة التي تهدف إلى تسريع استدلال الذكاء الاصطناعي - بناءً على وضع Ultrafast الذي قدمته الشركات في وقت سابق من أغسطس، والذي جلب GPT-5.6 Sol للمستخدمين بما يصل إلى 750 رمزًا في الثانية.
تحذيرات خلف الأرقام الرئيسية
ويحث محللو الصناعة على توخي الحذر بشأن أرقام التسويق. يشير السجل إلى أن عنوان Cerebras الرئيسي 250 بيتافلوبس يعتمد على التناثر، والذي لا يفيد بشكل عام استدلال نموذج اللغة الكبير، وأن أرقام عرض النطاق الترددي الأقصى للذاكرة نظرية إلى حد كبير نظرًا لأن WSE-3 يفتقر إلى الحساب لتشبع SRAM الخاص به. تساءل المنشور أيضًا عن سبب مضاعفة Cerebras للأداء بدلاً من زيادة سعة SRAM، والتي لم تنمو بشكل ملموس منذ إطلاق WSE-2 قبل خمس سنوات - وهو خيار غريب في عصر الاستدلال المجزأ حيث تستفيد مسرعات فك التشفير أكثر من الذاكرة.
ومع ذلك، فإن فرصة السوق حقيقية. نظرًا لأن روبوتات الدردشة والوكلاء الذين يعملون بالذكاء الاصطناعي يطالبون بأوقات استجابة أسرع من أي وقت مضى، أصبحت سرعة الاستدلال عامل تمييز تنافسي حقيقي، وقد أثبتت شركة Cerebras الآن أنها تستطيع تكرار تقنيتها غير التقليدية على نطاق الرقاقات على إيقاع تجاري.
تبدأ الشحنات الأولى من طراز CS-4 في هذا الربع، ومن المتوقع وصول الأنظمة الأولى إلى الإنترنت قبل نهاية شهر سبتمبر. يبقى أن نرى ما إذا كان هذا كافيًا لتقليص هيمنة Nvidia - ولكن للمرة الأولى منذ فترة، أصبح أسرع استنتاج للذكاء الاصطناعي في الصناعة له عنوان جديد.
ابق في صدارة الذكاء الاصطناعي
تعمل عمليات إطلاق الأجهزة مثل CS-4 على تحريك الأسواق وإعادة تعريف ما يمكن أن تفعله أنظمة الذكاء الاصطناعي. اقرأ المزيد من أخبار الذكاء الاصطناعي لمواكبة كل تطور.
استكشف أحدث تغطية للذكاء الاصطناعي →