متا پرده MTIA 400 را کنار زده است، اولین شتاب دهنده سفارشی آن که دقیقاً هدفش آموزش مدل های زبان بزرگ است - با پیچ و تاب غیر معمول. این تراشه که این هفته در کنفرانس سالانه نیمه هادی Hot Chips به تفصیل شرح داده شد، همچنین بارهای کاری توصیه گر یادگیری عمیق را به همراه خواهد داشت که به تبلیغات کمک می کند تا کل جاه طلبی هوش مصنوعی متا را تامین کند.
رجیستر، که برای اولین بار افشای فنی کامل را گزارش کرد، این طرح را «شخصیت دوگانه» نامید: یک تراشه آموزش مرزی در یک طرف، یک موتور ارائه دهنده تبلیغات در طرف دیگر. این واضحترین نشانهای است که متا قصد دارد آینده هوش مصنوعی خود را بر روی سیلیکون خود اجرا کند. برای اطلاعات بیشتر در مورد [آخرین تحولات هوش مصنوعی] (https://aibuzzwire.news) که صنعت تراشه را شکل می دهد، AI Buzz Wire را دنبال کنید.
چرا هوش مصنوعی را آموزش دهیم و تبلیغات را روی یک تراشه ارائه دهیم؟
اکثر شرکتهایی که شتابدهندههای هوش مصنوعی سفارشی میسازند با استنتاج شروع میکنند. خوشه ها کوچکتر هستند، تراشه ها ساده تر هستند و کار به خوبی درک شده است. متا با هدف قرار دادن آموزش LLM - محاسباتی ترین حجم کاری در صنعت که اغلب به ده ها یا صدها هزار شتاب دهنده نیاز دارد، این روند را کاهش می دهد.
سازش بار کار دوم است. استنتاج DLRM - مدل توصیهگر یادگیری عمیق که تصمیم میگیرد کاربران کدام آگهیها و پستها را ببینند - عمدتاً به جای محاسبات محدود به حافظه است، به این معنی که بسیاری از قدرت آتش آموزشی تراشه در طول ارائه تبلیغات بیکار میماند. اما با توجه به اینکه متا دهها میلیارد دلار در محاسبات میسوزاند، داشتن یک وظیفه مضاعف کشش یک تراشه یک مانع عملی است، به خصوص زمانی که یکی از دو مورد استفاده مستقیماً درآمد ایجاد میکند.
داخل MTIA 400: تراشههای 3 نانومتری و IP Broadcom
با توجه به ارائه Hot Chips متا، همانطور که توسط The Register و ServeTheHome تجزیه و تحلیل شده است:
- معماری چند قالبی: دو قالب محاسباتی، دو قالب ورودی/خروجی، و یک قالب SoC که اتصال میزبان و هماهنگی حجم کار را مدیریت می کند.
- گره فرآیند: تراشه های محاسباتی بر اساس فناوری فرآیند 3 نانومتری، احتمالاً از TSMC ساخته شده اند.
- محاسبه: یک شبکه 6x8 از عناصر پردازشی در هر چیپلت، که 12 پتافلاپ ترکیبی از محاسبات MXFP4 را در 1.7 گیگاهرتز ارائه می کند.
- حافظه: هشت پشته 36 گیگابایتی HBM3e — مجموعاً 288 گیگابایت با پهنای باند تقریباً 9.2 ترابایت بر ثانیه
- ارتباط: 1.2 ترابایت در ثانیه پهنای باند تراشه به تراشه از طریق RDMA، احتمالا اترنت با توجه به دخالت Broadcom
اثر انگشت Broadcom همه جا هست. ثبت اشاره میکند که شتابدهنده تقریباً با استفاده از IP XPU طراح تراشه ساخته شده است - یک انتخاب عملگرایانه که به Meta اجازه میدهد تا روی تمایز تمرکز کند در حالی که بخشهای غیر جذاب طراحی شتابدهنده را برون سپاری میکند.
چگونه در برابر Nvidia و AMD قرار می گیرد
تصویر عملکرد ظریف است. MTIA 400 با دقت بالاتری که معمولاً برای تمرین استفاده میشود، تقریباً 20 درصد سریعتر از شتابدهندههای بلکول انویدیا است و در عین حال قدرت مشابهی را میگیرد. پهنای باند حافظه آن حدود 15 درصد بهتر از قطعات نسل قبلی انویدیا و AMD است.
اما در برابر جدیدترین نسل، شکاف به شدت افزایش مییابد: MTIA 400 به ترتیب بین 3 تا 3.3 برابر کندتر از Rubin انویدیا و AMD Instinct MI455X است و کمتر از نیمی از پهنای باند حافظه آن GPUهای جدید را ارائه میکند. این کسری دقیقاً به همین دلیل است که متا این قطعه را بهجای یک تراشه استنتاج به عنوان یک تراشه آموزشی قرار میدهد – برای ارائه توکنها، گزینههای بسیار سریعتری دارد.
در سطح سیستم، شباهت به قفسه های استاندارد صنعتی قابل توجه است. هر تیغه محاسباتی چهار شتاب دهنده MTIA 400 را با یک سوئیچ PCIe، یک CPU x86 و یک NIC کوچککننده جفت میکند. یک رک کامل 18 تیغه محاسباتی و هشت تیغه سوئیچ را در خود جای میدهد - 72 شتابدهنده در یک دامنه واحد، پیکربندی که منعکسکننده طرحهای NVL72 انویدیا و طراحی رک Helios AMD است. اسلایدهای متا بدون تعیین سقف های خوشه ای، "مقیاس سازی چند هزار شتاب دهنده" را وعده می دهند.
نقشه راه: MTIA 450 سال آینده
MTIA 400 پایان خط نیست. متا در ماه مارس فاش کرد که برنامهای برای انتشار شش ماهه در چهار نسل جدید MTIA دارد و توقف بعدی MTIA 450 است - یک نوع بهینهسازی استنتاج که انتظار میرود پهنای باند حافظه را دو برابر کند، احتمالاً با استفاده از HBM4. این تراشه برای تولید در سال آینده برنامه ریزی شده است و باید برای اجرای بارهای کاری توصیه شده مبتنی بر LLM مناسب باشد.
با وجود پیشرفت، تحلیل The Register صریح است: سیلیکون داخلی متا به این زودی جایگزین پردازندههای گرافیکی AMD یا Nvidia نخواهد شد. Meta Superintelligence Labs تقریباً به طور قطع هنوز در حال آموزش مدلهای مرزی بر روی پردازندههای گرافیکی معمولی است و سختافزار ویژه برنامهها برای بارهای کاری پایدار و درک شده مناسب هستند.
چرا مهم است
MTIA 400 به دو دلیل اهمیت دارد. اول، یک ابر مقیاس کننده را نشان می دهد که مایل به حمله به سخت ترین حجم کاری - آموزش مرزی - است به جای انتخاب برنده های استنتاج آسان. دوم، جنبه تبلیغاتی طراحی یادآور اقتصاد است: هر دلار سرمایه در سیلیکون سفارشی توسط سودآورترین تجارت تبلیغاتی در تاریخ نوشته شده است. اگر متا بتواند حتی کسری از بارهای آموزشی و توصیههای خود را از پردازندههای گرافیکی تجاری خارج کند، صرفهجویی در مقیاس آن به میلیاردها میرسد.
منابع: ارائه Meta's Hot Chips 2026، The Register و ServeTheHome.
---
از هوش مصنوعی جلوتر بمانیدآخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.
بیشتر بخوانید اخبار هوش مصنوعی →