سربراس CS-4 را که یک سیستم استنتاج هوش مصنوعی در مقیاس قفسهای است که حول پردازنده جدید WSE-3 Turbo ساخته شده است، اعلام کرده است و ادعا میکند که دستگاه تا 30 برابر سریعتر از سیستمهای مبتنی بر GPU استنتاج میدهد زیرا این شرکت خود را جایگزین سرعت برای امپراتوری مرکز داده انویدیا میداند.
این راهاندازی که روز سهشنبه اعلام شد و جزئیات آن در صفحات محصولات شرکت و موجی از پوششهای رویترز، بلومبرگ و رجیستر منتشر شد، مهمترین بهروزرسانی سختافزار Cerebras از زمان عرضه عمومی را نشان میدهد – و لحظهای مهم برای شرکتی که سهامش از زمان عرضه اولیه سهام با مشکل مواجه شده است. به نظر میرسد سرمایهگذاران توجه دارند: سهام Cerebras (CBRS) با این خبر افزایش یافت، و Investor's Business Daily به نقل از تفسیر مدیر عامل شرکت مبنی بر اینکه بازار استنتاج هوش مصنوعی "به سرعت در حال رشد است."
برای خوانندگانی که مسابقه شتابدهنده را دنبال میکنند تا مدلهای هوش مصنوعی سریعتر پاسخ دهند، راهاندازی CS-4 یکی از مهمترین داستانهای سختافزاری این سهماهه است و در بحبوحه تغییرات گستردهتر در پوشش صنعت هوش مصنوعی که همچنان به تغییر شکل چشمانداز محاسباتی ادامه میدهد، فرود میآید.
چه چیزی در داخل CS-4 است
جزء اصلی WSE-3 Turbo است، نسخه ارتقا یافتهای از موتور ویفر در اندازه بشقاب شام. طبق بررسی عمیق فنی The Register، WSE-3T سیلیکون جدیدی نیست - همان فرآیند TSMC 5 نانومتری، 46225 میلیمتر مربع مساحت، 4 تریلیون ترانزیستور، 900000 هسته و 44 گیگابایت SRAM روی ویفر را مانند WSE-33 دو ساله حفظ میکند.
در عوض، Cerebras با فشار دادن بسیار بیشتر بر تراشه موجود، به دو برابر شدن عملکرد خود دست یافت. WSE-3T محاسبات FP16 پراکنده را دو برابر به 250 پتافلاپ، عملکرد متراکم FP16 را به 25 پتافلاپ تخمین زده، دو برابر پهنای باند حافظه به 43.2 پتابایت در ثانیه و پهنای باند ورودی/خروجی را به 2.4 ترابیت در ثانیه دو برابر می کند. رجیستر تخمین می زند که این شرکت اکنون سیلیکون را تقریباً 2.8 گیگاهرتز کلاک می کند، در حالی که در نسل قبلی حدود 1.4 گیگاهرتز بود.
به گفته سربراس، این ترفند، یک سیستم تحویل انرژی بازطراحی شده است که فقط 0.5 میلی متر از پردازنده فاصله دارد - تقریباً 100 برابر نزدیکتر از 50 میلی متر معمولی بردهای GPU معمولی. این نزدیکی تقریباً تلفات برق در سطح برد را حذف می کند و اجازه می دهد تا دو برابر قدرت به ویفر برسد و فرکانس های عملیاتی بالاتر را در پشت تولید سریعتر توکن ممکن می کند.
معماری Rack Nexus
فراتر از خود تراشه، CS-4 چیزی را معرفی میکند که Cerebras آن را Nexus Platform Architecture مینامد، اولین طراحی واقعی آن در مقیاس رک و پاسخی مستقیم به NVL72 انویدیا و سیستمهای رک Helios AMD. هر CS-4 میتواند حداکثر سه پردازنده WSE-3T را که در "کولهپشتیهای مقیاس ویفری" قرار دارند حمل کند - بستههای سه بعدی که ویفر، تبدیل نیرو، خنککننده مستقیم مایع، ورودی/خروجی با سرعت بالا و کنترل الکترونیک را در یک مجموعه واحد با 50 درصد اجزای کمتر تا میکنند.
طراحی ماژولار توان پایدار، خنک کننده و لایه شبکه را از محاسبات جدا می کند. به گفته این شرکت، یک Cerebras PowerRack را می توان قبل از رسیدن به هر محاسباتی نصب کرد و برای تسهیلات واجد شرایط شد، و سپس کوله پشتی ها در جای خود قرار می گیرند - به گفته این شرکت، زمان استقرار را از روزها به ساعت ها کاهش می دهد.
مصرف برق قابل توجه است. رجیستر حدود 46 کیلو وات در هر کوله پشتی و مجموع مصرف سیستم 120 تا 140 کیلووات را تخمین می زند - اعداد چشم نوازی که با این وجود در کنار سیستم های رک 240 تا 250 کیلوواتی AMD و Nvidia که اواخر امسال عرضه خواهند شد محافظه کارانه به نظر می رسند.
کشتن سوئیچ
شاید از نظر فنی جالب ترین انتخاب، اتصال متقابل باشد. به جای مسیریابی ترافیک ویفر به ویفر از طریق سوئیچ ها - رویکردی که AWS برای شتاب دهنده های Trainium3 خود اتخاذ کرده است - Cerebras تراشه های خود را به یک توپولوژی توروس دو بعدی متصل می کند که در آن ویفرهای همسایه مستقیماً با یکدیگر صحبت می کنند. این طرح تأخیر ویفر به ویفر را از پنج میکروثانیه به تنها دو کاهش میدهد و Cerebras میگوید که این مش میتواند مدلهایی با حداکثر 50 تریلیون پارامتر را پشتیبانی کند، به راحتی فراتر از هر چیزی که در حال حاضر وجود دارد.
نتایج سرعت قابل توجه است. در یک سیستم CS-4، شرکت محکگذاری Artificial Analysis تا 4400 توکن در ثانیه را برای هر کاربر در gpt-oss-120b اندازهگیری کرد که تقریباً 12 برابر 350 توکن در ثانیه سریعترین سرویسهای استنتاج مبتنی بر GPU موجود امروزی است. Cerebras همچنین ادعا می کند که این سیستم بیش از 1000 توکن در ثانیه را در مدل هایی با بیش از 10 تریلیون پارامتر حفظ می کند.
استراتژی مشارکت تفکیک شده
نکته قابل توجه، سربراس دیگر تلاش نمی کند تا کل خط لوله استنتاج را روی سیلیکون خودش اجرا کند. این شرکت با AWS و AMD همکاری کرده است تا مرحله پردازش سریع محاسباتی استنتاج را به ترتیب روی پردازندههای گرافیکی Trainium XPU و Instinct تخلیه کند، و موتورهای مقیاس ویفر خود را برای رسیدگی به فاز رمزگشایی حساس به تأخیر، جایی که ذخایر عظیم SRAM آنها میدرخشد، واگذار کرده است.
پرتاب CS-4 همچنین همکاری Cerebras با OpenAI را گسترش می دهد. یاهو فایننس این رونمایی را در کنار مشارکتهای OpenAI و AMD با هدف تسریع استنباط هوش مصنوعی گزارش کرد - بر اساس حالت Ultrafast که شرکتها در اوایل ماه اوت معرفی کردند، که GPT-5.6 Sol را با حداکثر 750 توکن در ثانیه برای کاربران به ارمغان آورد.
هشدارهای پشت سر اعداد
تحلیلگران صنعت توصیه می کنند که در ارقام بازاریابی کمی احتیاط شود. ثبت اشاره میکند که سرفصل 250 پتافلاپس Cerebras بر پراکندگی تکیه میکند، که معمولاً به استنباط مدل زبانی بزرگ کمک نمیکند، و ارقام حداکثر پهنای باند حافظه تا حد زیادی تئوری هستند زیرا WSE-3 فاقد محاسبات برای اشباع SRAM خود بود. این نشریه همچنین این سوال را مطرح کرد که چرا Cerebras به جای افزایش ظرفیت SRAM، که از زمان راه اندازی WSE-2 پنج سال پیش به طور معنی داری رشد نکرده است، عملکرد را دو برابر کرد - یک انتخاب عجیب در عصر استنتاج تفکیک شده که در آن شتاب دهنده های رمزگشایی بیشترین بهره را از حافظه می برند.
با این حال، فرصت بازار واقعی است. از آنجایی که چتباتها و عاملهای هوش مصنوعی زمان پاسخگویی سریعتری را میطلبند، سرعت استنتاج به یک تمایز رقابتی واقعی تبدیل شده است و Cerebras اکنون نشان داده است که میتواند فناوری غیر متعارف مقیاس ویفر خود را در آهنگ تجاری تکرار کند.
اولین محمولههای CS-4 در این سهماهه آغاز میشود و انتظار میرود اولین سیستمها قبل از پایان سپتامبر آنلاین شوند. اینکه آیا این برای کاهش تسلط انویدیا کافی است یا نه، باید دید - اما برای اولین بار پس از مدتی، سریعترین استنتاج هوش مصنوعی در صنعت آدرس جدیدی دارد.
از هوش مصنوعی جلوتر بمانید
راهاندازیهای سختافزاری مانند CS-4 بازارها را به حرکت در میآورد و آنچه را که سیستمهای هوش مصنوعی میتوانند انجام دهند، بازتعریف میکنند. [اخبار هوش مصنوعی را بیشتر بخوانید] (https://aibuzzwire.news) تا با هر پیشرفتی همراه باشید.
آخرین پوشش هوش مصنوعی را کاوش کنید →