Meta приоткрыла завесу над MTIA 400, своим первым специальным ускорителем, предназначенным непосредственно для обучения больших языковых моделей — с необычной особенностью. Чип, подробно описанный на этой неделе на ежегодной полупроводниковой конференции Hot Chips, также будет нести рекомендательные нагрузки по глубокому обучению, которые служат рекламе, финансирующей все амбиции Meta в области искусственного интеллекта.

The Register, впервые опубликовавший полную техническую информацию, назвал конструкцию «раздвоением личности»: с одной стороны обучающий чип, с другой — рекламный движок. Это самый явный признак того, что Meta намерена построить свое будущее искусственного интеллекта на собственном кремнии. Чтобы узнать больше о последних разработках в области искусственного интеллекта, формирующих индустрию микросхем, следите за новостями AI Buzz Wire.

Зачем обучать ИИ и показывать рекламу на одном чипе?

Большинство компаний, создающих собственные ускорители искусственного интеллекта, начинают с вывода. Кластеры меньше, чипы проще, работа понятна. Meta противостоит этой тенденции, ориентируясь в первую очередь на обучение LLM — самую ресурсоемкую рабочую нагрузку в отрасли, часто требующую десятков или сотен тысяч ускорителей.

Компромисс — это вторая рабочая нагрузка. Вывод DLRM — рекомендательная модель глубокого обучения, которая решает, какую рекламу и сообщения видят пользователи — преимущественно привязан к памяти, а не к вычислениям, а это означает, что большая часть обучающей огневой мощи чипа простаивает во время показа рекламы. Но поскольку Meta тратит десятки миллиардов долларов на вычисления, использование одного чипа с двойной нагрузкой является прагматичным хеджированием, особенно когда один из двух вариантов использования напрямую генерирует доход.

Внутри MTIA 400: 3-нм чиплеты и Broadcom IP

Согласно презентации Hot Chips Meta, проанализированной The Register и ServeTheHome:

  • Многокристальная архитектура: два вычислительных кристалла, два кристалла ввода-вывода и кристалл SoC, обеспечивающий подключение хоста и оркестрацию рабочей нагрузки.
  • Технологический узел: Вычислительные чиплеты построены по 3-нм техпроцессу, предположительно от TSMC.
  • Вычисления: сетка вычислительных элементов 6x8 на каждый чиплет, обеспечивающая общую производительность вычислений MXFP4 12 петафлопс на частоте 1,7 ГГц.
  • Память: Восемь стеков HBM3e по 36 ГБ — всего 288 ГБ с пропускной способностью примерно 9,2 ТБ/с.
  • Межсоединение: пропускная способность между чипами 1,2 ТБ/с через RDMA, скорее всего Ethernet, учитывая участие Broadcom.

Отпечатки пальцев Broadcom повсюду. The Register отмечает, что ускоритель почти наверняка был построен с использованием XPU IP разработчика чипа — прагматичный выбор, который позволяет Meta сосредоточиться на дифференциации, одновременно передавая на аутсорсинг непривлекательные части конструкции ускорителя.

Чем он отличается от Nvidia и AMD

Картина производительности имеет нюансы. При более высокой точности, обычно используемой для обучения, MTIA 400 примерно на 20% быстрее, чем топовые ускорители Blackwell от Nvidia, потребляя при этом аналогичную мощность. Пропускная способность его памяти примерно на 15% лучше, чем у компонентов Nvidia и AMD предыдущего поколения.

Но по сравнению с новейшим поколением разрыв резко увеличивается: MTIA 400 в 3–3,3 раза медленнее, чем Rubin от Nvidia и Instinct MI455X от AMD соответственно, и обеспечивает менее половины пропускной способности памяти этих новых графических процессоров. Именно из-за этого дефицита Meta позиционирует эту деталь как обучающий чип, а не как чип вывода — для обслуживания токенов у него есть гораздо более быстрые варианты.

На системном уровне сходство со стандартными стойками просто поразительно. Каждый вычислительный модуль объединяет четыре ускорителя MTIA 400 с коммутатором PCIe, процессором x86 и масштабируемой сетевой платой. Полная стойка вмещает 18 вычислительных модулей и восемь модулей коммутаторов — 72 ускорителя в одном унифицированном домене, конфигурация, которая отражает конструкции стоек Nvidia NVL72 и AMD Helios. Слайды Meta обещают «многотысячное масштабирование ускорителей» без указания предельных значений кластера.

Дорожная карта: MTIA 450 в следующем году

MTIA 400 — это не конец линейки. В марте компания Meta сообщила, что планирует выпускать четыре новых поколения MTIA с шестимесячной периодичностью, а следующей остановкой станет MTIA 450 — вариант, оптимизированный для вывода, который, как ожидается, удвоит пропускную способность памяти, предположительно за счет внедрения HBM4. Производство этого чипа запланировано на следующий год, и он должен хорошо подходить для выполнения рекомендательных рабочих нагрузок на основе LLM.

Несмотря на прогресс, анализ The Register однозначен: собственные чипы Meta не заменят графические процессоры AMD или Nvidia в ближайшее время. Meta Superintelligence Labs почти наверняка все еще обучает передовые модели на обычных графических процессорах, а аппаратное обеспечение для конкретных приложений по-прежнему лучше всего подходит для понятных и стабильных рабочих нагрузок.

Почему это важно

MTIA 400 важен по двум причинам. Во-первых, это показывает, что гиперскейлер готов взяться за самую тяжелую рабочую нагрузку — передовое обучение — вместо того, чтобы добиваться легких результатов. Во-вторых, рекламная сторона дизайна является напоминанием об экономике: каждый доллар капвложений в заказной кремний гарантирован самым прибыльным рекламным бизнесом в истории. Если Meta сможет перенести хотя бы часть своих рабочих нагрузок по обучению и рекомендациям с торговых графических процессоров, экономия в ее масштабе будет измеряться миллиардами.

Источники: презентация Meta's Hot Chips 2026, The Register и ServeTheHome.

---

Будьте впереди ИИ

Получайте последние новости, анализ и открытия в области искусственного интеллекта — все в одном месте.

Подробнее новости AI →