اینتل کنفرانس تراشه های داغ امسال را با بررسی عمیق در جزیره کرسنت، پردازنده گرافیکی مرکز داده ای که برای فاز بعدی حجم کاری هوش مصنوعی شرط بندی کرده است، آغاز کرد: استنتاج عامل. این گفتگو که توسط Sumit Mohan، معمار ارشد سیستمهای هوش مصنوعی سازمانی و هونگ جیانگ، عضو اینتل ارائه شد، بر سه معیار متمرکز بود که شرکت میگوید دوره عامل را تعریف میکند: توکنها در هر وات، ظرفیت حافظه بزرگ و پشته نرمافزار باز.
زمان مهم است انویدیا از همان کنفرانس برای جزئیات سیستم رک مقیاس Vera Rubin NVL72 خود استفاده کرد و هر فروشنده شتاب دهنده در Hot Chips 2026 اکنون به جای اوج عملکرد خام، کارایی را ارائه می دهد. پاسخ اینتل بخشی است که فناوری حافظه اصلی را که پردازندههای گرافیکی هوش مصنوعی استفاده میکنند با چیزی ارزانتر در هر گیگابایت تعویض میکند و باعث میشود اعداد سرفصل قابلتوجهی ایجاد شود. For more context on this story, see our ongoing AI trends.
یک کارت PCIe 480 گیگابایتی با توان 350 وات
کرسنت جزیره یک پردازنده گرافیکی PCIe 350 واتی با هوا خنک است. کارتهای برند اینتل با 160 گیگابایت حافظه LPDDR5X عرضه میشوند، اما این طراحی به شرکای ODM اجازه میدهد تا انواعی را با حداکثر 480 گیگابایت بسازند - تقریباً سه برابر ظرفیت کارتهای شتابدهنده معمولی و به اندازه کافی برای نگه داشتن حافظه پنهان KV بسیار بزرگ برای کارهای طولانی مدت و چند جلسه. این طرح انواع داده از FP4 و MXFP4 تا FP64 را پوشش می دهد.
انتخاب حافظه، تصمیم استراتژیک در محصول است. LPDDR5X پهنای باند را با ظرفیت و هزینه معاوضه میکند، که متناسب با مشخصات بار کاری استنتاج است که در آن پنجرههای زمینه عظیم و حلقههای فراخوانی ابزار، ظرفیت حافظه را بیشتر از محاسبات خام مصرف میکنند. اینتل کل طراحی را حول محور "توکن ها در هر وات" قاب بندی می کند - به جای برنده شدن در مقایسه های اوج FLOPS، خروجی مفیدتری در واحد انرژی ارائه می دهد.
سیلیکون Xe3P: 32 هسته، 256 موتور XMX
در زیر کاپوت، جزیره کرسنت معماری Xe3P اینتل است و اینتل آن را به عنوان یک جهش نسلی نسبت به نسل Xe2 مبتنی بر Battlemage ارائه کرده است. جایی که Xe2 20 هسته Xe و یک آرایه سیستولیک XMX با 4 عمق را ارائه میکند، جزیره کرسنت 32 هسته Xe و یک آرایه سیستولیک 16 عمقی را ارائه میکند که در مجموع 256 موتور XMX را تغذیه میکند.
نسل سوم برنامههای افزودنی Xe Matrix یک طراحی ماتریس توسعهیافته سهطرفه Xe با انتشار همزمان دقیق FP4 و پشتیبانی از FP64 را اضافه میکند. هر هسته Xe یک فایل رجیستر عمومی 1 مگابایتی و حافظه نهان L1 به حجم 512 کیلوبایت دارد و یک L2 یکپارچه 32 مگابایتی در سراسر دستگاه به اشتراک گذاشته شده است. یک موتور رسانه ای با چهار رمزگشا و چهار رمزگذار در کنار هم قرار دارد و کل SoC از طریق PCIe Gen5 x16 با پشتیبانی از افزایش مقیاس در یک پارچه سوئیچ باز متصل می شود. اینتل یک توان بیکار فعال 50 وات یا کمتر در حالت G0 و تقریباً 10 وات در حالت کم مصرف G8 را فهرست می کند که از طریق دامنه های برق توزیع شده، روترهای شبکه روی تراشه مبتنی بر بسته با گیت ساعت تهاجمی و ریل های DVFS مستقل برای گرافیک و رسانه به دست می آید.
ویژگی های RAS قرض گرفته شده از راهنمای سرور
برای بخش مرکز داده، مهندسی قابلیت اطمینان به اندازه توان عملیاتی زمان مرحله دارد - موضوعی که انویدیا نیز با Vera Rubin به آن متمایل شد. کرسنت جزیره ECC و برابری را در ساختارهای کلیدی حافظه، بررسی خطا در هر پرش از فابریک اتصال داخلی، آفلاین کردن صفحه پویا، تعمیر سخت پس از بستهبندی، و گزارش خطای پیشرفته PCI Express را حمل میکند. اینتل میگوید این ترکیب خرابی دادههای بیصدا را کاهش میدهد، حالت شکستی که برای استنتاج طولانیمدت بدون نظارت مهمتر است.
اینتل همچنین این قطعه را در داخل مجموعهای قرار داده است که از پردازندههای گرافیکی ایستگاه کاری Arc Pro از طریق RDUهای SambaNova SN50 که به دست آورده است، با کرسنت جزیره به عنوان لنگر مرکز داده سازمانی در بالا قرار گرفته است. این شرکت یک خط و نسب نقشه راه را نشان داد که بیش از شش سال پیش بود و GPU را به عنوان یک طراحی بالغ نسل سوم به جای اولین تلاش معرفی کرد. این کارت برای اولین بار در ماه ژوئن در Computex رونمایی شد. هات چیپس جزئیات معماری پشت آن را ارائه کرد.
چرا استنتاج عامل از این طرح حمایت می کند
بحث حجم کار جالبترین بخش پیشرفت اینتل است. هوش مصنوعی عاملی - مدلهایی که ابزارهای زنجیرهای را فراخوانی میکنند، زمینههای طولانی را باز نگه میدارند و بین CPU و GPU هماهنگ میکنند - بهجای نمایه پردازش دستهای سرویسدهی ربات چت، تأخیر، ظرفیت حافظه و توان عملیاتی سیستم را به طور همزمان کاهش میدهند. ظرفیت حافظه نهان KV برای زمینه های طولانی و جلسات همزمان با دامنه فشرده به صراحت در طراحی SoC تعبیه شده است.
این قاب بندی شرط LPDDR5X را نیز توضیح می دهد. اگر موج بعدی محاسبات هوش مصنوعی به جای اجرای تمرین، عوامل تشنه حافظه باشد، یک کارت 480 گیگابایتی با 350 وات جایگزین معتبری برای قطعات ممتاز مبتنی بر HBM است - به شرطی که پشته نرم افزار ارائه دهد. تاکید اینتل بر روی پشته باز و پارچه سوئیچ باز دقیقاً متوجه خریدارانی است که نسبت به قفل پلت فرم یکپارچه انویدیا محتاط هستند.
جزیره کرسنت جایگزین شتابدهندههای آموزشی که بر سرفصلهای هوش مصنوعی غالب هستند، نمیشود و اینتل قیمت یا در دسترس بودن آن را در کنفرانس فاش نکرد. اما بهعنوان بیانیهای در مورد اینکه اینتل فکر میکند استنتاج به کجا میرود - حافظه چرب، قدرت ناب، پارچه باز - یکی از واضحتر داستانهای معماری Hot Chips امسال است.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →