متا پرده MTIA 400 را کنار زده است، اولین شتاب دهنده سفارشی آن که دقیقاً هدفش آموزش مدل های زبان بزرگ است - با پیچ و تاب غیر معمول. این تراشه که این هفته در کنفرانس سالانه نیمه هادی Hot Chips به تفصیل شرح داده شد، همچنین بارهای کاری توصیه گر یادگیری عمیق را به همراه خواهد داشت که به تبلیغات کمک می کند تا کل جاه طلبی هوش مصنوعی متا را تامین کند.

رجیستر، که برای اولین بار افشای فنی کامل را گزارش کرد، این طرح را «شخصیت دوگانه» نامید: یک تراشه آموزش مرزی در یک طرف، یک موتور ارائه دهنده تبلیغات در طرف دیگر. این واضح‌ترین نشانه‌ای است که متا قصد دارد آینده هوش مصنوعی خود را بر روی سیلیکون خود اجرا کند. برای اطلاعات بیشتر در مورد [آخرین تحولات هوش مصنوعی] (https://aibuzzwire.news) که صنعت تراشه را شکل می دهد، AI Buzz Wire را دنبال کنید.

چرا هوش مصنوعی را آموزش دهیم و تبلیغات را روی یک تراشه ارائه دهیم؟

اکثر شرکت‌هایی که شتاب‌دهنده‌های هوش مصنوعی سفارشی می‌سازند با استنتاج شروع می‌کنند. خوشه ها کوچکتر هستند، تراشه ها ساده تر هستند و کار به خوبی درک شده است. متا با هدف قرار دادن آموزش LLM - محاسباتی ترین حجم کاری در صنعت که اغلب به ده ها یا صدها هزار شتاب دهنده نیاز دارد، این روند را کاهش می دهد.

سازش بار کار دوم است. استنتاج DLRM - مدل توصیه‌گر یادگیری عمیق که تصمیم می‌گیرد کاربران کدام آگهی‌ها و پست‌ها را ببینند - عمدتاً به جای محاسبات محدود به حافظه است، به این معنی که بسیاری از قدرت آتش آموزشی تراشه در طول ارائه تبلیغات بیکار می‌ماند. اما با توجه به اینکه متا ده‌ها میلیارد دلار در محاسبات می‌سوزاند، داشتن یک وظیفه مضاعف کشش یک تراشه یک مانع عملی است، به خصوص زمانی که یکی از دو مورد استفاده مستقیماً درآمد ایجاد می‌کند.

داخل MTIA 400: تراشه‌های 3 نانومتری و IP Broadcom

با توجه به ارائه Hot Chips متا، همانطور که توسط The Register و ServeTheHome تجزیه و تحلیل شده است:

  • معماری چند قالبی: دو قالب محاسباتی، دو قالب ورودی/خروجی، و یک قالب SoC که اتصال میزبان و هماهنگی حجم کار را مدیریت می کند.
  • گره فرآیند: تراشه های محاسباتی بر اساس فناوری فرآیند 3 نانومتری، احتمالاً از TSMC ساخته شده اند.
  • محاسبه: یک شبکه 6x8 از عناصر پردازشی در هر چیپلت، که 12 پتافلاپ ترکیبی از محاسبات MXFP4 را در 1.7 گیگاهرتز ارائه می کند.
  • حافظه: هشت پشته 36 گیگابایتی HBM3e — مجموعاً 288 گیگابایت با پهنای باند تقریباً 9.2 ترابایت بر ثانیه
  • ارتباط: 1.2 ترابایت در ثانیه پهنای باند تراشه به تراشه از طریق RDMA، احتمالا اترنت با توجه به دخالت Broadcom

اثر انگشت Broadcom همه جا هست. ثبت اشاره می‌کند که شتاب‌دهنده تقریباً با استفاده از IP XPU طراح تراشه ساخته شده است - یک انتخاب عمل‌گرایانه که به Meta اجازه می‌دهد تا روی تمایز تمرکز کند در حالی که بخش‌های غیر جذاب طراحی شتاب‌دهنده را برون سپاری می‌کند.

چگونه در برابر Nvidia و AMD قرار می گیرد

تصویر عملکرد ظریف است. MTIA 400 با دقت بالاتری که معمولاً برای تمرین استفاده می‌شود، تقریباً 20 درصد سریع‌تر از شتاب‌دهنده‌های بلک‌ول انویدیا است و در عین حال قدرت مشابهی را می‌گیرد. پهنای باند حافظه آن حدود 15 درصد بهتر از قطعات نسل قبلی انویدیا و AMD است.

اما در برابر جدیدترین نسل، شکاف به شدت افزایش می‌یابد: MTIA 400 به ترتیب بین 3 تا 3.3 برابر کندتر از Rubin انویدیا و AMD Instinct MI455X است و کمتر از نیمی از پهنای باند حافظه آن GPUهای جدید را ارائه می‌کند. این کسری دقیقاً به همین دلیل است که متا این قطعه را به‌جای یک تراشه استنتاج به عنوان یک تراشه آموزشی قرار می‌دهد – برای ارائه توکن‌ها، گزینه‌های بسیار سریع‌تری دارد.

در سطح سیستم، شباهت به قفسه های استاندارد صنعتی قابل توجه است. هر تیغه محاسباتی چهار شتاب دهنده MTIA 400 را با یک سوئیچ PCIe، یک CPU x86 و یک NIC کوچک‌کننده جفت می‌کند. یک رک کامل 18 تیغه محاسباتی و هشت تیغه سوئیچ را در خود جای می‌دهد - 72 شتاب‌دهنده در یک دامنه واحد، پیکربندی که منعکس‌کننده طرح‌های NVL72 انویدیا و طراحی رک Helios AMD است. اسلایدهای متا بدون تعیین سقف های خوشه ای، "مقیاس سازی چند هزار شتاب دهنده" را وعده می دهند.

نقشه راه: MTIA 450 سال آینده

MTIA 400 پایان خط نیست. متا در ماه مارس فاش کرد که برنامه‌ای برای انتشار شش ماهه در چهار نسل جدید MTIA دارد و توقف بعدی MTIA 450 است - یک نوع بهینه‌سازی استنتاج که انتظار می‌رود پهنای باند حافظه را دو برابر کند، احتمالاً با استفاده از HBM4. این تراشه برای تولید در سال آینده برنامه ریزی شده است و باید برای اجرای بارهای کاری توصیه شده مبتنی بر LLM مناسب باشد.

با وجود پیشرفت، تحلیل The Register صریح است: سیلیکون داخلی متا به این زودی جایگزین پردازنده‌های گرافیکی AMD یا Nvidia نخواهد شد. Meta Superintelligence Labs تقریباً به طور قطع هنوز در حال آموزش مدل‌های مرزی بر روی پردازنده‌های گرافیکی معمولی است و سخت‌افزار ویژه برنامه‌ها برای بارهای کاری پایدار و درک شده مناسب هستند.

چرا مهم است

MTIA 400 به دو دلیل اهمیت دارد. اول، یک ابر مقیاس کننده را نشان می دهد که مایل به حمله به سخت ترین حجم کاری - آموزش مرزی - است به جای انتخاب برنده های استنتاج آسان. دوم، جنبه تبلیغاتی طراحی یادآور اقتصاد است: هر دلار سرمایه در سیلیکون سفارشی توسط سودآورترین تجارت تبلیغاتی در تاریخ نوشته شده است. اگر متا بتواند حتی کسری از بارهای آموزشی و توصیه‌های خود را از پردازنده‌های گرافیکی تجاری خارج کند، صرفه‌جویی در مقیاس آن به میلیاردها می‌رسد.

منابع: ارائه Meta's Hot Chips 2026، The Register و ServeTheHome.

---

از هوش مصنوعی جلوتر بمانید

آخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.

بیشتر بخوانید اخبار هوش مصنوعی →