Meta відсунула завісу над MTIA 400, своїм першим спеціальним прискорювачем, спрямованим прямо на навчання великих мовних моделей — з незвичайним поворотом. Чіп, детально описаний цього тижня на щорічній напівпровідниковій конференції Hot Chips, також виконуватиме робочі навантаження рекомендацій щодо глибокого навчання, які обслуговують рекламу, що фінансує всі амбіції Meta щодо штучного інтелекту.
Регістр, який першим оприлюднив повні технічні відомості, назвав дизайн «роздвоєнням особистості»: з одного боку чіп для навчання кордону, з іншого — механізм розміщення реклами. Це найяскравіша ознака того, що Meta має намір керувати своїм майбутнім ШІ на власному кремнії. Щоб дізнатися більше про [останні розробки штучного інтелекту] (https://aibuzzwire.news), які формують індустрію мікросхем, слідкуйте за новинами AI Buzz Wire.
Навіщо тренувати ШІ та розміщувати рекламу на одному чіпі?
Більшість компаній, які створюють спеціальні прискорювачі ШІ, починають із висновків. Кластери менші, чіпи простіші, а завдання добре зрозуміле. Meta намагається протистояти цій тенденції, націлюючись в першу чергу на навчання LLM — найбільш інтенсивне робоче навантаження в галузі, яке часто потребує десятків або сотень тисяч прискорювачів.
Компромісом є друге навантаження. Висновок DLRM — рекомендована модель глибокого навчання, яка визначає, яку рекламу та публікації бачитимуть користувачі — переважно пов’язана з пам’яттю, а не з обчисленнями, тобто більша частина тренувальної вогневої потужності чіпа не використовується під час показу реклами. Але враховуючи те, що Meta витрачає десятки мільярдів доларів на обчислення, наявність подвійного обов’язку одного чіпа є прагматичним хеджуванням, особливо коли один із двох варіантів використання безпосередньо генерує дохід.
Всередині MTIA 400: 3-нм мікросхеми та Broadcom IP
Відповідно до презентації Meta Hot Chips, проаналізованої The Register і ServeTheHome:
- Багатокристалічна архітектура: два обчислювальних кристали, два блоки вводу/виводу та процесор SoC, що обслуговує підключення до хоста та оркестрування робочого навантаження.
- Процесний вузол: обчислювальні чіплети створені за 3-нм техпроцесом, імовірно, від TSMC
- Обчислення: сітка 6x8 елементів обробки на чіплет, що забезпечує сумарну продуктивність 12 петафлопс MXFP4 на частоті 1,7 ГГц.
- Пам'ять: Вісім стеків HBM3e по 36 ГБ — загальна кількість 288 ГБ із пропускною здатністю приблизно 9,2 ТБ/с
- Інтерконнект: 1,2 ТБ/с пропускної здатності чіп-чіп через RDMA, ймовірно, Ethernet з огляду на участь Broadcom
Відбитки Broadcom всюди. Реєстр зазначає, що прискорювач майже напевно був створений з використанням XPU IP розробника чіпа — прагматичний вибір, який дозволяє Meta зосередитися на диференціації, одночасно передаючи непривабливі частини дизайну прискорювача аутсорсингу.
Як він протиставляється Nvidia та AMD
Картина виконання має нюанси. З високою точністю, яка зазвичай використовується для навчання, MTIA 400 приблизно на 20% швидший, ніж топові прискорювачі Blackwell від Nvidia, споживаючи аналогічну потужність. Його пропускна здатність пам’яті приблизно на 15% краща, ніж у частин попереднього покоління Nvidia та AMD.
Але порівняно з новим поколінням розрив різко збільшується: MTIA 400 у 3-3,3 рази повільніше, ніж Rubin від Nvidia та Instinct MI455X від AMD відповідно, і він пропонує менше половини пропускної здатності пам’яті, ніж ці нові графічні процесори. Саме через цей дефіцит Meta позиціонує цю частину як навчальну мікросхему, а не як мікросхему висновків — для обслуговування токенів вона має набагато швидші параметри.
На системному рівні схожість зі стандартними промисловими стійками вражає. Кожен обчислювальний блейд поєднує чотири прискорювачі MTIA 400 з комутатором PCIe, процесором x86 і масштабованою мережевою карткою. Повна стійка вміщує 18 обчислювальних блейдів і вісім блейд-комутаторів — 72 прискорювачі в одному об’єднаному домені, конфігурація, яка відображає конструкції стійки NVL72 від Nvidia та Helios від AMD. Слайди Meta обіцяють «багатотисячне масштабування прискорювачів» без вказівки меж кластерів.
Дорожня карта: MTIA 450 наступного року
MTIA 400 – це не кінець лінії. У березні Meta повідомила, що планує шестимісячний випуск чотирьох нових поколінь MTIA, а наступною зупинкою стане MTIA 450 — оптимізований для висновків варіант, який, як очікується, подвоїть пропускну здатність пам’яті, ймовірно, за рахунок прийняття HBM4. Виробництво цього чіпа заплановано на наступний рік, і він повинен добре підходити для виконання робочих навантажень на основі рекомендацій LLM.
Незважаючи на прогрес, аналіз The Register прямолінійний: власний процесор Meta не замінить графічні процесори AMD або Nvidia найближчим часом. Meta Superintelligence Labs майже напевно все ще навчає передові моделі на звичайних графічних процесорах, а спеціальне апаратне забезпечення як і раніше найкраще підходить для добре зрозумілих, стабільних робочих навантажень.
Чому це важливо
MTIA 400 має значення з двох причин. По-перше, він показує, що гіпермасштабувальник готовий атакувати найважче робоче навантаження — передовий тренінг — замість того, щоб отримувати легкі висновки. По-друге, сторона дизайну, пов’язана з розміщенням реклами, є нагадуванням про економіку: кожен долар капіталовкладень на нестандартний силікон гарантується найприбутковішим рекламним бізнесом в історії. Якщо Meta зможе перенести хоч частину свого робочого навантаження з навчання та рекомендацій з торгових графічних процесорів, економія в її масштабі буде вимірюватися мільярдами.
Джерела: презентація Meta Hot Chips 2026, The Register і ServeTheHome.
---
Будьте попереду ШІОтримуйте останні новини штучного інтелекту, аналіз і прориви — усе в одному місці.
Читати більше новин AI →