Meta heeft het gordijn opengetrokken voor de MTIA 400, de eerste aangepaste accelerator die volledig gericht is op het trainen van grote taalmodellen – met een ongewone twist. De chip, die deze week werd besproken op de jaarlijkse Hot Chips-halfgeleiderconferentie, zal ook de deep learning-aanbevelingswerklasten dragen die dienen voor de advertenties die Meta's volledige AI-ambitie financieren.
Het Register, dat voor het eerst de volledige technische onthullingen rapporteerde, noemde het ontwerp een ‘gespleten persoonlijkheid’: een chip voor grenstraining aan de ene kant, een advertentie-serving-engine aan de andere kant. Het is het duidelijkste teken tot nu toe dat Meta van plan is haar AI-toekomst op haar eigen silicium te laten draaien. Voor meer informatie over de nieuwste AI-ontwikkelingen die de chipindustrie vormgeven, volgt u AI Buzz Wire.
Waarom AI trainen en advertenties weergeven op dezelfde chip?
De meeste bedrijven die op maat gemaakte AI-versnellers bouwen, beginnen met gevolgtrekkingen. Clusters zijn kleiner, de chips zijn eenvoudiger en de taak is goed begrepen. Meta gaat tegen deze trend in door zich eerst te richten op LLM-training – de meest rekenintensieve werklast in de branche, waarvoor vaak tien- of honderdduizenden accelerators nodig zijn.
Het compromis is de tweede werklast. DLRM-gevolgtrekking – het deep learning-aanbevelingsmodel dat beslist welke advertenties en berichten gebruikers zien – is voornamelijk geheugengebonden in plaats van computergebonden, wat betekent dat een groot deel van de trainingsvuurkracht van de chip inactief blijft tijdens het weergeven van advertenties. Maar nu Meta tientallen miljarden dollars aan rekenkracht verbrandt, is het hebben van één chip-pull-dubbele plicht een pragmatische afdekking, vooral wanneer een van de twee gebruiksscenario's direct inkomsten genereert.
Binnenin de MTIA 400: 3nm-chiplets en Broadcom IP
Volgens Meta's Hot Chips-presentatie, zoals geanalyseerd door The Register en ServeTheHome:
- Multi-die-architectuur: Twee compute-dies, twee I/O-dies en een SoC-die die de hostconnectiviteit en werklastorkestratie afhandelt
- Procesknooppunt: De computerchiplets zijn gebouwd op 3nm-procestechnologie, vermoedelijk van TSMC
- Compute: Een 6x8 raster van verwerkingselementen per chiplet, wat een gecombineerde 12 petaFLOPS aan MXFP4-compute levert op 1,7 GHz
- Geheugen: Acht HBM3e-stacks van 36 GB — 288 GB totaal met ongeveer 9,2 TB/s bandbreedte
- Interconnect: 1,2 TB/s chip-naar-chip bandbreedte via RDMA, waarschijnlijk Ethernet gezien de betrokkenheid van Broadcom
De vingerafdrukken van Broadcom zijn overal. Het Register merkt op dat de versneller vrijwel zeker is gebouwd met behulp van de XPU IP van de chipontwerper - een pragmatische keuze waarmee Meta zich kan concentreren op differentiatie terwijl de niet-glamoureuze delen van het versnellerontwerp worden uitbesteed.
Hoe het zich verhoudt tot Nvidia en AMD
Het prestatiebeeld is genuanceerd. Bij de hogere precisie die gewoonlijk voor training wordt gebruikt, is de MTIA 400 ongeveer 20% sneller dan Nvidia's topspecificatie Blackwell-accelerators, terwijl hij een vergelijkbaar vermogen trekt. De geheugenbandbreedte is ongeveer 15% beter dan die van Nvidia en AMD's vorige generatie onderdelen.
Maar ten opzichte van de nieuwste generatie wordt de kloof scherp groter: de MTIA 400 is tussen de 3x en 3,3x langzamer dan respectievelijk Nvidia's Rubin en AMD's Instinct MI455X, en biedt minder dan de helft van de geheugenbandbreedte van die nieuwe GPU's. Dat tekort is precies de reden waarom Meta het onderdeel positioneert als een trainingschip in plaats van als een gevolgtrekkingschip – voor het serveren van tokens heeft het veel snellere opties.
Op systeemniveau is de gelijkenis met industriestandaard racks opvallend. Elke compute-blade combineert vier MTIA 400-accelerators met een PCIe-switch, een x86 CPU en een scale-out NIC. Een volledig rack bevat 18 compute-blades en acht switch-blades: 72 accelerators in één verenigd domein, een configuratie die de NVL72-rackontwerpen van Nvidia en AMD's Helios-rack weerspiegelt. Meta's dia's beloven "multi-duizend accelerator scaling" zonder clusterplafonds te specificeren.
De routekaart: MTIA 450 volgend jaar
De MTIA 400 is niet het einde van de lijn. Meta maakte in maart bekend dat het een release-cadans van zes maanden plant voor vier nieuwe MTIA-generaties, en de volgende stop is de MTIA 450 – een voor gevolgtrekkingen geoptimaliseerde variant die naar verwachting de geheugenbandbreedte zal verdubbelen, vermoedelijk door de adoptie van HBM4. Die chip staat gepland voor productie volgend jaar en zou zeer geschikt moeten zijn voor het uitvoeren van op LLM gebaseerde aanbevelingsworkloads.
Ondanks de vooruitgang is de analyse van The Register bot: Meta's interne silicium zal AMD- of Nvidia-GPU's niet snel vervangen. Meta Superintelligence Labs traint vrijwel zeker nog steeds grensmodellen op conventionele GPU's, en applicatiespecifieke hardware blijft het meest geschikt voor goed begrepen, stabiele werklasten.
Waarom het ertoe doet
De MTIA 400 is om twee redenen belangrijk. Ten eerste laat het een hyperscaler zien die bereid is om de zwaarste werklast aan te pakken – grenstraining – in plaats van gemakkelijke conclusies te trekken. Ten tweede herinnert de advertentiekant van het ontwerp aan de economische aspecten: elke dollar aan investeringen in speciaal silicium wordt onderschreven door het meest winstgevende reclamebedrijf uit de geschiedenis. Als Meta zelfs maar een fractie van de trainings- en aanbevelingswerklast van de GPU's van verkopers kan verschuiven, zouden de besparingen op zijn schaal in miljarden worden gemeten.
Bronnen: Meta's Hot Chips 2026-presentatie, The Register en ServeTheHome.
---
Blijf AI een stap voorOntvang het laatste AI-nieuws, analyses en doorbraken – allemaal op één plek.
Lees meer AI-nieuws →