سربراس CS-4 را که یک سیستم استنتاج هوش مصنوعی در مقیاس قفسه‌ای است که حول پردازنده جدید WSE-3 Turbo ساخته شده است، اعلام کرده است و ادعا می‌کند که دستگاه تا 30 برابر سریع‌تر از سیستم‌های مبتنی بر GPU استنتاج می‌دهد زیرا این شرکت خود را جایگزین سرعت برای امپراتوری مرکز داده انویدیا می‌داند.

این راه‌اندازی که روز سه‌شنبه اعلام شد و جزئیات آن در صفحات محصولات شرکت و موجی از پوشش‌های رویترز، بلومبرگ و رجیستر منتشر شد، مهم‌ترین به‌روزرسانی سخت‌افزار Cerebras از زمان عرضه عمومی را نشان می‌دهد – و لحظه‌ای مهم برای شرکتی که سهامش از زمان عرضه اولیه سهام با مشکل مواجه شده است. به نظر می‌رسد سرمایه‌گذاران توجه دارند: سهام Cerebras (CBRS) با این خبر افزایش یافت، و Investor's Business Daily به نقل از تفسیر مدیر عامل شرکت مبنی بر اینکه بازار استنتاج هوش مصنوعی "به سرعت در حال رشد است."

برای خوانندگانی که مسابقه شتاب‌دهنده را دنبال می‌کنند تا مدل‌های هوش مصنوعی سریع‌تر پاسخ دهند، راه‌اندازی CS-4 یکی از مهم‌ترین داستان‌های سخت‌افزاری این سه‌ماهه است و در بحبوحه تغییرات گسترده‌تر در پوشش صنعت هوش مصنوعی که همچنان به تغییر شکل چشم‌انداز محاسباتی ادامه می‌دهد، فرود می‌آید.

چه چیزی در داخل CS-4 است

جزء اصلی WSE-3 Turbo است، نسخه ارتقا یافته‌ای از موتور ویفر در اندازه بشقاب شام. طبق بررسی عمیق فنی The Register، WSE-3T سیلیکون جدیدی نیست - همان فرآیند TSMC 5 نانومتری، 46225 میلی‌متر مربع مساحت، 4 تریلیون ترانزیستور، 900000 هسته و 44 گیگابایت SRAM روی ویفر را مانند WSE-33 دو ساله حفظ می‌کند.

در عوض، Cerebras با فشار دادن بسیار بیشتر بر تراشه موجود، به دو برابر شدن عملکرد خود دست یافت. WSE-3T محاسبات FP16 پراکنده را دو برابر به 250 پتافلاپ، عملکرد متراکم FP16 را به 25 پتافلاپ تخمین زده، دو برابر پهنای باند حافظه به 43.2 پتابایت در ثانیه و پهنای باند ورودی/خروجی را به 2.4 ترابیت در ثانیه دو برابر می کند. رجیستر تخمین می زند که این شرکت اکنون سیلیکون را تقریباً 2.8 گیگاهرتز کلاک می کند، در حالی که در نسل قبلی حدود 1.4 گیگاهرتز بود.

به گفته سربراس، این ترفند، یک سیستم تحویل انرژی بازطراحی شده است که فقط 0.5 میلی متر از پردازنده فاصله دارد - تقریباً 100 برابر نزدیکتر از 50 میلی متر معمولی بردهای GPU معمولی. این نزدیکی تقریباً تلفات برق در سطح برد را حذف می کند و اجازه می دهد تا دو برابر قدرت به ویفر برسد و فرکانس های عملیاتی بالاتر را در پشت تولید سریعتر توکن ممکن می کند.

معماری Rack Nexus

فراتر از خود تراشه، CS-4 چیزی را معرفی می‌کند که Cerebras آن را Nexus Platform Architecture می‌نامد، اولین طراحی واقعی آن در مقیاس رک و پاسخی مستقیم به NVL72 انویدیا و سیستم‌های رک Helios AMD. هر CS-4 می‌تواند حداکثر سه پردازنده WSE-3T را که در "کوله‌پشتی‌های مقیاس ویفری" قرار دارند حمل کند - بسته‌های سه بعدی که ویفر، تبدیل نیرو، خنک‌کننده مستقیم مایع، ورودی/خروجی با سرعت بالا و کنترل الکترونیک را در یک مجموعه واحد با 50 درصد اجزای کمتر تا می‌کنند.

طراحی ماژولار توان پایدار، خنک کننده و لایه شبکه را از محاسبات جدا می کند. به گفته این شرکت، یک Cerebras PowerRack را می توان قبل از رسیدن به هر محاسباتی نصب کرد و برای تسهیلات واجد شرایط شد، و سپس کوله پشتی ها در جای خود قرار می گیرند - به گفته این شرکت، زمان استقرار را از روزها به ساعت ها کاهش می دهد.

مصرف برق قابل توجه است. رجیستر حدود 46 کیلو وات در هر کوله پشتی و مجموع مصرف سیستم 120 تا 140 کیلووات را تخمین می زند - اعداد چشم نوازی که با این وجود در کنار سیستم های رک 240 تا 250 کیلوواتی AMD و Nvidia که اواخر امسال عرضه خواهند شد محافظه کارانه به نظر می رسند.

کشتن سوئیچ

شاید از نظر فنی جالب ترین انتخاب، اتصال متقابل باشد. به جای مسیریابی ترافیک ویفر به ویفر از طریق سوئیچ ها - رویکردی که AWS برای شتاب دهنده های Trainium3 خود اتخاذ کرده است - Cerebras تراشه های خود را به یک توپولوژی توروس دو بعدی متصل می کند که در آن ویفرهای همسایه مستقیماً با یکدیگر صحبت می کنند. این طرح تأخیر ویفر به ویفر را از پنج میکروثانیه به تنها دو کاهش می‌دهد و Cerebras می‌گوید که این مش می‌تواند مدل‌هایی با حداکثر 50 تریلیون پارامتر را پشتیبانی کند، به راحتی فراتر از هر چیزی که در حال حاضر وجود دارد.

نتایج سرعت قابل توجه است. در یک سیستم CS-4، شرکت محک‌گذاری Artificial Analysis تا 4400 توکن در ثانیه را برای هر کاربر در gpt-oss-120b اندازه‌گیری کرد که تقریباً 12 برابر 350 توکن در ثانیه سریع‌ترین سرویس‌های استنتاج مبتنی بر GPU موجود امروزی است. Cerebras همچنین ادعا می کند که این سیستم بیش از 1000 توکن در ثانیه را در مدل هایی با بیش از 10 تریلیون پارامتر حفظ می کند.

استراتژی مشارکت تفکیک شده

نکته قابل توجه، سربراس دیگر تلاش نمی کند تا کل خط لوله استنتاج را روی سیلیکون خودش اجرا کند. این شرکت با AWS و AMD همکاری کرده است تا مرحله پردازش سریع محاسباتی استنتاج را به ترتیب روی پردازنده‌های گرافیکی Trainium XPU و Instinct تخلیه کند، و موتورهای مقیاس ویفر خود را برای رسیدگی به فاز رمزگشایی حساس به تأخیر، جایی که ذخایر عظیم SRAM آنها می‌درخشد، واگذار کرده است.

پرتاب CS-4 همچنین همکاری Cerebras با OpenAI را گسترش می دهد. یاهو فایننس این رونمایی را در کنار مشارکت‌های OpenAI و AMD با هدف تسریع استنباط هوش مصنوعی گزارش کرد - بر اساس حالت Ultrafast که شرکت‌ها در اوایل ماه اوت معرفی کردند، که GPT-5.6 Sol را با حداکثر 750 توکن در ثانیه برای کاربران به ارمغان آورد.

هشدارهای پشت سر اعداد

تحلیلگران صنعت توصیه می کنند که در ارقام بازاریابی کمی احتیاط شود. ثبت اشاره می‌کند که سرفصل 250 پتافلاپس Cerebras بر پراکندگی تکیه می‌کند، که معمولاً به استنباط مدل زبانی بزرگ کمک نمی‌کند، و ارقام حداکثر پهنای باند حافظه تا حد زیادی تئوری هستند زیرا WSE-3 فاقد محاسبات برای اشباع SRAM خود بود. این نشریه همچنین این سوال را مطرح کرد که چرا Cerebras به جای افزایش ظرفیت SRAM، که از زمان راه اندازی WSE-2 پنج سال پیش به طور معنی داری رشد نکرده است، عملکرد را دو برابر کرد - یک انتخاب عجیب در عصر استنتاج تفکیک شده که در آن شتاب دهنده های رمزگشایی بیشترین بهره را از حافظه می برند.

با این حال، فرصت بازار واقعی است. از آنجایی که چت‌بات‌ها و عامل‌های هوش مصنوعی زمان پاسخگویی سریع‌تری را می‌طلبند، سرعت استنتاج به یک تمایز رقابتی واقعی تبدیل شده است و Cerebras اکنون نشان داده است که می‌تواند فناوری غیر متعارف مقیاس ویفر خود را در آهنگ تجاری تکرار کند.

اولین محموله‌های CS-4 در این سه‌ماهه آغاز می‌شود و انتظار می‌رود اولین سیستم‌ها قبل از پایان سپتامبر آنلاین شوند. اینکه آیا این برای کاهش تسلط انویدیا کافی است یا نه، باید دید - اما برای اولین بار پس از مدتی، سریعترین استنتاج هوش مصنوعی در صنعت آدرس جدیدی دارد.

از هوش مصنوعی جلوتر بمانید

راه‌اندازی‌های سخت‌افزاری مانند CS-4 بازارها را به حرکت در می‌آورد و آنچه را که سیستم‌های هوش مصنوعی می‌توانند انجام دهند، بازتعریف می‌کنند. [اخبار هوش مصنوعی را بیشتر بخوانید] (https://aibuzzwire.news) تا با هر پیشرفتی همراه باشید.

آخرین پوشش هوش مصنوعی را کاوش کنید →