سیریبراس نے اپنے نئے WSE-3 ٹربو ویفر اسکیل پروسیسر کے ارد گرد بنایا ہوا ایک ریک اسکیل AI انفرنس سسٹم CS-4 کو ختم کر دیا ہے، اور دعویٰ کیا ہے کہ یہ مشین GPU پر مبنی سسٹمز کے مقابلے میں 30 گنا زیادہ تیز انفرنس فراہم کرتی ہے کیونکہ کمپنی خود کو Nvidia کے ڈیٹا سینٹر ایمپائر کے اسپیڈ متبادل کے طور پر رکھتی ہے۔

لانچ، جس کا منگل کو اعلان کیا گیا اور کمپنی کے پروڈکٹ پیجز پر تفصیلی اور رائٹرز، بلومبرگ اور دی رجسٹر کی جانب سے کوریج کی ایک لہر، سیریبراس کے عوامی ہونے کے بعد سے سب سے اہم ہارڈ ویئر ریفریش کی نشاندہی کرتی ہے - اور ایک ایسی کمپنی کے لیے ایک اہم لمحہ جس کا اسٹاک اپنے IPO کے بعد سے جدوجہد کر رہا ہے۔ ایسا لگتا ہے کہ سرمایہ کار توجہ دے رہے ہیں: خبروں پر سیریبراس (سی بی آر ایس) کے حصص میں اضافہ ہوا، اور انویسٹرس بزنس ڈیلی نے سی ای او کے تبصرے کا حوالہ دیا کہ اے آئی انفرنس مارکیٹ "اتنی تیزی سے بڑھ رہی ہے۔"

AI ماڈلز کو تیزی سے جواب دینے کے لیے تیز رفتاری کی دوڑ کو ٹریک کرنے والے قارئین کے لیے، CS-4 کا آغاز سہ ماہی کی سب سے زیادہ نتیجہ خیز ہارڈویئر کہانیوں میں سے ایک ہے، اور یہ AI انڈسٹری کی کوریج میں وسیع تر تبدیلیوں کے درمیان اترتا ہے جو کمپیوٹ لینڈ سکیپ کو نئی شکل دینا جاری رکھے ہوئے ہے۔

CS-4 کے اندر کیا ہے۔

ہیڈ لائن کا جزو WSE-3 ٹربو ہے، جو Cerebras کے ڈنر پلیٹ کے سائز کے Wafer Scale Engine کا اپ گریڈ شدہ ورژن ہے۔ The Register کے تکنیکی گہرے غوطے کے مطابق، WSE-3T نیا سلیکون نہیں ہے — یہ وہی TSMC 5nm عمل، 46,225 مربع ملی میٹر ڈائی ایریا، 4 ٹریلین ٹرانزسٹر، 900,000 کور اور 44 GB آن-wafer SRAM کو دو سالہ WSE کے طور پر برقرار رکھتا ہے۔

اس کے بجائے، سیریبراس نے موجودہ چپ کو زیادہ سختی سے دھکیل کر اپنی کارکردگی کو دوگنا کر دیا۔ WSE-3T sparse FP16 کمپیوٹ کو 250 petaFLOPS سے دگنا کرتا ہے، FP16 کی کارکردگی کو تخمینہ شدہ 25 petaFLOPS سے دگنا کرتا ہے، میموری کی بینڈوتھ کو 43.2 پیٹا بائٹس فی سیکنڈ تک دگنا کرتا ہے، اور I/O بینڈوتھ کو 2.4 ٹیرا بائٹس فی سیکنڈ تک دگنا کرتا ہے۔ رجسٹر کا تخمینہ ہے کہ کمپنی اب سلکان کو تقریباً 2.8 GHz پر کر رہی ہے، جو پچھلی نسل میں تقریباً 1.4 GHz سے زیادہ ہے۔

سیریبراس کے مطابق، یہ چال ایک نئے سرے سے ڈیزائن کیا گیا پاور ڈیلیوری سسٹم ہے جو پروسیسر سے صرف 0.5 ملی میٹر کے فاصلے پر ہے - جو روایتی GPU بورڈز کے ~ 50 ملی میٹر کے مقابلے میں تقریباً 100 گنا زیادہ ہے۔ یہ قربت بورڈ کی سطح پر بجلی کے نقصان کو تقریباً ختم کر دیتی ہے اور دوگنا زیادہ طاقت کو ویفر تک پہنچنے کی اجازت دیتی ہے، جس سے تیز تر ٹوکن جنریشن کے پیچھے اعلیٰ آپریٹنگ فریکوئنسیوں کو فعال کیا جا سکتا ہے۔

نیکسس ریک آرکیٹیکچر

خود چپ سے ہٹ کر، CS-4 متعارف کراتا ہے جسے Cerebras Nexus پلیٹ فارم آرکیٹیکچر کہتے ہیں، اس کا پہلا حقیقی ریک اسکیل ڈیزائن اور Nvidia کے NVL72 اور AMD کے Helios ریک سسٹم کا براہ راست جواب۔ ہر CS-4 تین WSE-3T پروسیسر لے جا سکتا ہے جو خود ساختہ "وفر اسکیل بیک پیک" میں رکھے ہوئے ہیں - 3D پیکیجز جو ویفر، پاور کنورژن، ڈائریکٹ مائع کولنگ، تیز رفتار I/O اور کنٹرول الیکٹرانکس کو 50% کم اجزاء کے ساتھ ایک ہی اسمبلی میں فولڈ کرتے ہیں۔

ماڈیولر ڈیزائن مستحکم طاقت، کولنگ اور نیٹ ورک کی تہہ کو کمپیوٹ سے الگ کرتا ہے۔ کسی بھی کمپیوٹ کے آنے سے پہلے ایک Cerebras PowerRack کو انسٹال کیا جا سکتا ہے اور سہولت کے لیے کوالیفائی کیا جا سکتا ہے، اور بیک بیگ پھر جگہ پر پھسل جاتے ہیں - کمپنی کے مطابق، تعیناتی کے وقت کو دنوں سے گھنٹوں تک کم کرتے ہیں۔

بجلی کی کھپت کافی ہے۔ رجسٹر کا تخمینہ لگ بھگ 46 کلو واٹ فی بیگ ہے اور کل سسٹم ڈرا 120 سے 140 کلوواٹ ہے - جو کہ اس کے باوجود 240 سے 250 کلو واٹ کے ریک سسٹمز AMD اور Nvidia کے اس سال کے آخر میں بھیجے جانے کی توقع ہے کہ وہ چشم کشا نمبر ہیں۔

سوئچ کو مارنا

شاید سب سے زیادہ تکنیکی طور پر دلچسپ انتخاب آپس میں جڑنا ہے۔ سوئچز کے ذریعے ویفر ٹو ویفر ٹریفک کو روٹ کرنے کے بجائے - AWS نے اپنے Trainium3 ایکسلریٹر کے لیے اپنایا ہوا طریقہ - Cerebras اپنی چپس کو 2D ٹورس ٹوپولوجی میں تار لگاتا ہے جہاں پڑوسی ویفرز ایک دوسرے سے براہ راست بات کرتے ہیں۔ یہ ڈیزائن ویفر ٹو ویفر کی تاخیر کو پانچ مائیکرو سیکنڈز سے کم کر کے صرف دو کر دیتا ہے، اور سیریبراس کا کہنا ہے کہ میش 50 ٹریلین پیرامیٹرز تک کے ماڈلز کو سپورٹ کر سکتی ہے، آرام سے اس وقت موجود کسی بھی چیز سے آگے۔

رفتار کے نتائج حیران کن ہیں۔ ایک واحد CS-4 سسٹم پر، بینچ مارکنگ فرم مصنوعی تجزیہ نے gpt-oss-120b پر فی صارف 4,400 ٹوکن فی سیکنڈ تک ماپا - آج دستیاب تیز ترین GPU پر مبنی انفرنس سروسز کے ~350 ٹوکن فی سیکنڈ سے تقریباً 12 گنا۔ سیریبراس کا یہ بھی دعویٰ ہے کہ یہ سسٹم 10 ٹریلین پیرامیٹرز سے زیادہ ماڈلز پر 1000 ٹوکن فی سیکنڈ سے زیادہ برقرار رکھتا ہے۔

ایک متضاد شراکت کی حکمت عملی

قابل ذکر بات یہ ہے کہ سیریبراس اب پوری انفرنس پائپ لائن کو اپنے سلکان پر چلانے کی کوشش نہیں کر رہا ہے۔ کمپنی نے AWS اور AMD کے ساتھ اشتراک کیا ہے تاکہ بالترتیب Trainium XPUs اور Instinct GPUs پر کمپیوٹ-انٹینسیو پرامپٹ پروسیسنگ مرحلے کو آف لوڈ کیا جا سکے، اس کے ویفر اسکیل انجنوں کو تاخیر سے حساس ڈی کوڈ مرحلے کو سنبھالنے کے لیے چھوڑ دیا گیا ہے جہاں ان کے بڑے پیمانے پر SRAM ذخائر چمک رہے ہیں۔

CS-4 کا آغاز OpenAI کے ساتھ Cerebras کے تعاون کو بھی بڑھاتا ہے۔ Yahoo Finance نے نئی OpenAI اور AMD پارٹنرشپس کے ساتھ نقاب کشائی کی اطلاع دی جس کا مقصد AI inference کو تیز کرنا ہے — کمپنیاں جو اگست کے اوائل میں متعارف کرائی گئی تھیں الٹرا فاسٹ موڈ پر تعمیر، جس نے GPT-5.6 Sol کو صارفین کے لیے 750 ٹوکن فی سیکنڈ تک پہنچایا۔

سرخی کے نمبروں کے پیچھے انتباہات

صنعت کے تجزیہ کار مارکیٹنگ کے اعداد و شمار پر کچھ احتیاط کی تاکید کرتے ہیں۔ رجسٹر نوٹ کرتا ہے کہ Cerebras کی سرخی 250 petaFLOPS sparsity پر انحصار کرتی ہے، جس سے عام طور پر بڑے لینگویج ماڈل کا اندازہ نہیں ہوتا، اور وہ چوٹی میموری بینڈوڈتھ کے اعداد و شمار بڑی حد تک نظریاتی ہیں کیونکہ WSE-3 کے پاس اپنے SRAM کو سیر کرنے کے لیے کمپیوٹ کی کمی ہے۔ اشاعت میں یہ سوال بھی اٹھایا گیا کہ سیریبراس نے SRAM کی صلاحیت کو بڑھانے کے بجائے کارکردگی کو دگنا کیوں کیا، جو کہ WSE-2 کے پانچ سال قبل شروع ہونے کے بعد سے معنی خیز طور پر نہیں بڑھی ہے - ایک متضاد اندازے کے دور میں ایک دلچسپ انتخاب جہاں ڈی کوڈ ایکسلریٹر میموری سے سب سے زیادہ فائدہ اٹھاتے ہیں۔

پھر بھی، مارکیٹ کا موقع حقیقی ہے۔ جیسا کہ AI چیٹ بوٹس اور ایجنٹس تیزی سے ردعمل کے اوقات کا مطالبہ کرتے ہیں، انفرنس اسپیڈ ایک حقیقی مسابقتی تفریق کار بن گئی ہے، اور Cerebras نے اب یہ ثابت کر دیا ہے کہ وہ تجارتی کیڈنس پر اپنی غیر روایتی ویفر اسکیل ٹیکنالوجی کو اعادہ کر سکتا ہے۔

پہلی CS-4 کی ترسیل اس سہ ماہی میں شروع ہوتی ہے، ستمبر کے آخر سے پہلے آن لائن آنے والے پہلے سسٹمز کے ساتھ۔ کیا یہ Nvidia کے غلبے کو ختم کرنے کے لئے کافی ہے یہ دیکھنا باقی ہے - لیکن تھوڑی دیر میں پہلی بار، صنعت میں تیز ترین AI تخمینہ کا ایک نیا پتہ ہے۔

AI سے آگے رہیں

ہارڈ ویئر لانچ ہوتا ہے جیسے CS-4 منڈیوں کو منتقل کرتا ہے اور اس کی نئی وضاحت کرتا ہے کہ AI سسٹم کیا کر سکتے ہیں۔ مزید AI خبریں پڑھیں ہر پیش رفت سے باخبر رہنے کے لیے۔

تازہ ترین AI کوریج دریافت کریں →