اینتل کنفرانس تراشه های داغ امسال را با بررسی عمیق در جزیره کرسنت، پردازنده گرافیکی مرکز داده ای که برای فاز بعدی حجم کاری هوش مصنوعی شرط بندی کرده است، آغاز کرد: استنتاج عامل. این گفتگو که توسط Sumit Mohan، معمار ارشد سیستم‌های هوش مصنوعی سازمانی و هونگ جیانگ، عضو اینتل ارائه شد، بر سه معیار متمرکز بود که شرکت می‌گوید دوره عامل را تعریف می‌کند: توکن‌ها در هر وات، ظرفیت حافظه بزرگ و پشته نرم‌افزار باز.

زمان مهم است انویدیا از همان کنفرانس برای جزئیات سیستم رک مقیاس Vera Rubin NVL72 خود استفاده کرد و هر فروشنده شتاب دهنده در Hot Chips 2026 اکنون به جای اوج عملکرد خام، کارایی را ارائه می دهد. پاسخ اینتل بخشی است که فناوری حافظه اصلی را که پردازنده‌های گرافیکی هوش مصنوعی استفاده می‌کنند با چیزی ارزان‌تر در هر گیگابایت تعویض می‌کند و باعث می‌شود اعداد سرفصل قابل‌توجهی ایجاد شود. For more context on this story, see our ongoing AI trends.

یک کارت PCIe 480 گیگابایتی با توان 350 وات

کرسنت جزیره یک پردازنده گرافیکی PCIe 350 واتی با هوا خنک است. کارت‌های برند اینتل با 160 گیگابایت حافظه LPDDR5X عرضه می‌شوند، اما این طراحی به شرکای ODM اجازه می‌دهد تا انواعی را با حداکثر 480 گیگابایت بسازند - تقریباً سه برابر ظرفیت کارت‌های شتاب‌دهنده معمولی و به اندازه کافی برای نگه داشتن حافظه پنهان KV بسیار بزرگ برای کارهای طولانی مدت و چند جلسه. این طرح انواع داده از FP4 و MXFP4 تا FP64 را پوشش می دهد.

انتخاب حافظه، تصمیم استراتژیک در محصول است. LPDDR5X پهنای باند را با ظرفیت و هزینه معاوضه می‌کند، که متناسب با مشخصات بار کاری استنتاج است که در آن پنجره‌های زمینه عظیم و حلقه‌های فراخوانی ابزار، ظرفیت حافظه را بیشتر از محاسبات خام مصرف می‌کنند. اینتل کل طراحی را حول محور "توکن ها در هر وات" قاب بندی می کند - به جای برنده شدن در مقایسه های اوج FLOPS، خروجی مفیدتری در واحد انرژی ارائه می دهد.

سیلیکون Xe3P: 32 هسته، 256 موتور XMX

در زیر کاپوت، جزیره کرسنت معماری Xe3P اینتل است و اینتل آن را به عنوان یک جهش نسلی نسبت به نسل Xe2 مبتنی بر Battlemage ارائه کرده است. جایی که Xe2 20 هسته Xe و یک آرایه سیستولیک XMX با 4 عمق را ارائه می‌کند، جزیره کرسنت 32 هسته Xe و یک آرایه سیستولیک 16 عمقی را ارائه می‌کند که در مجموع 256 موتور XMX را تغذیه می‌کند.

نسل سوم برنامه‌های افزودنی Xe Matrix یک طراحی ماتریس توسعه‌یافته سه‌طرفه Xe با انتشار همزمان دقیق FP4 و پشتیبانی از FP64 را اضافه می‌کند. هر هسته Xe یک فایل رجیستر عمومی 1 مگابایتی و حافظه نهان L1 به حجم 512 کیلوبایت دارد و یک L2 یکپارچه 32 مگابایتی در سراسر دستگاه به اشتراک گذاشته شده است. یک موتور رسانه ای با چهار رمزگشا و چهار رمزگذار در کنار هم قرار دارد و کل SoC از طریق PCIe Gen5 x16 با پشتیبانی از افزایش مقیاس در یک پارچه سوئیچ باز متصل می شود. اینتل یک توان بیکار فعال 50 وات یا کمتر در حالت G0 و تقریباً 10 وات در حالت کم مصرف G8 را فهرست می کند که از طریق دامنه های برق توزیع شده، روترهای شبکه روی تراشه مبتنی بر بسته با گیت ساعت تهاجمی و ریل های DVFS مستقل برای گرافیک و رسانه به دست می آید.

ویژگی های RAS قرض گرفته شده از راهنمای سرور

برای بخش مرکز داده، مهندسی قابلیت اطمینان به اندازه توان عملیاتی زمان مرحله دارد - موضوعی که انویدیا نیز با Vera Rubin به آن متمایل شد. کرسنت جزیره ECC و برابری را در ساختارهای کلیدی حافظه، بررسی خطا در هر پرش از فابریک اتصال داخلی، آفلاین کردن صفحه پویا، تعمیر سخت پس از بسته‌بندی، و گزارش خطای پیشرفته PCI Express را حمل می‌کند. اینتل می‌گوید این ترکیب خرابی داده‌های بی‌صدا را کاهش می‌دهد، حالت شکستی که برای استنتاج طولانی‌مدت بدون نظارت مهم‌تر است.

اینتل همچنین این قطعه را در داخل مجموعه‌ای قرار داده است که از پردازنده‌های گرافیکی ایستگاه کاری Arc Pro از طریق RDUهای SambaNova SN50 که به دست آورده است، با کرسنت جزیره به عنوان لنگر مرکز داده سازمانی در بالا قرار گرفته است. این شرکت یک خط و نسب نقشه راه را نشان داد که بیش از شش سال پیش بود و GPU را به عنوان یک طراحی بالغ نسل سوم به جای اولین تلاش معرفی کرد. این کارت برای اولین بار در ماه ژوئن در Computex رونمایی شد. هات چیپس جزئیات معماری پشت آن را ارائه کرد.

چرا استنتاج عامل از این طرح حمایت می کند

بحث حجم کار جالب‌ترین بخش پیشرفت اینتل است. هوش مصنوعی عاملی - مدل‌هایی که ابزارهای زنجیره‌ای را فراخوانی می‌کنند، زمینه‌های طولانی را باز نگه می‌دارند و بین CPU و GPU هماهنگ می‌کنند - به‌جای نمایه پردازش دسته‌ای سرویس‌دهی ربات چت، تأخیر، ظرفیت حافظه و توان عملیاتی سیستم را به طور همزمان کاهش می‌دهند. ظرفیت حافظه نهان KV برای زمینه های طولانی و جلسات همزمان با دامنه فشرده به صراحت در طراحی SoC تعبیه شده است.

این قاب بندی شرط LPDDR5X را نیز توضیح می دهد. اگر موج بعدی محاسبات هوش مصنوعی به جای اجرای تمرین، عوامل تشنه حافظه باشد، یک کارت 480 گیگابایتی با 350 وات جایگزین معتبری برای قطعات ممتاز مبتنی بر HBM است - به شرطی که پشته نرم افزار ارائه دهد. تاکید اینتل بر روی پشته باز و پارچه سوئیچ باز دقیقاً متوجه خریدارانی است که نسبت به قفل پلت فرم یکپارچه انویدیا محتاط هستند.

جزیره کرسنت جایگزین شتاب‌دهنده‌های آموزشی که بر سرفصل‌های هوش مصنوعی غالب هستند، نمی‌شود و اینتل قیمت یا در دسترس بودن آن را در کنفرانس فاش نکرد. اما به‌عنوان بیانیه‌ای در مورد اینکه اینتل فکر می‌کند استنتاج به کجا می‌رود - حافظه چرب، قدرت ناب، پارچه باز - یکی از واضح‌تر داستان‌های معماری Hot Chips امسال است.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →