AMD et Cerebras Systems ont dévoilé un partenariat technique pour construire un nouveau type d'infrastructure d'inférence d'IA, combinant la plate-forme Helios à l'échelle rack d'AMD avec le moteur Wafer-Scale Engine (WSE) de Cerebras dans un flux de travail unique et désagrégé. Annoncée lors de l'événement Advancing AI 2026 d'AMD le 23 juillet 2026, la collaboration vise directement les goulots d'étranglement en matière de latence et de débit qui ont fait de l'inférence l'un des problèmes les plus coûteux de l'ère de l'IA générative. Pour obtenir les dernières nouvelles sur ce secteur en évolution rapide de l'industrie, suivez notre couverture des dernières actualités sur l'IA.
L’idée centrale est d’arrêter de forcer une seule puce à tout faire. Dans une pile d'inférence traditionnelle, une seule famille de GPU gère à la fois le lourd travail de pré-remplissage consistant à digérer une invite et le travail délicat et séquentiel de génération de chaque nouveau jeton. C'est un compromis, car les deux métiers ont des exigences très différentes. AMD et Cerebras soutiennent que la répartition du travail, une technique connue sous le nom d'inférence désagrégée, permet à chaque moteur de faire ce qu'il fait le mieux.
Comment les deux moteurs se répartissent le travail
Selon l'annonce officielle d'AMD, AMD Helios servira de moteur à débit évolutif et hautes performances, s'appuyant sur les GPU AMD Instinct pour traiter rapidement de gros lots d'entrées. Le moteur Cerebras Wafer-Scale Engine, quant à lui, gérera le décodage et la génération de jetons ultra-rapides et à très faible latence. Les puces de Cerebras sont construites sur des tranches entières plutôt que découpées en puces individuelles, ce qui leur confère une énorme bande passante mémoire sur puce, particulièrement adaptée à la diffusion en continu de jetons sans blocage.
Les sociétés affirment qu'en combinant les deux moteurs de calcul, la solution commune devrait fournir jusqu'à 5 fois plus de jetons par seconde et par watt, une mesure qui est devenue un tableau de bord central pour l'économie d'inférence alors que les fournisseurs sont en concurrence sur la vitesse et les coûts énergétiques. Ce chiffre a été cité dans le communiqué de presse d'AMD et rapporté par des médias tels que Tom's Hardware, Investing.com et Yahoo Tech.
Une chance contre la domination de Nvidia
Le partenariat est également un signal stratégique. L'écosystème CUDA et la gamme de GPU de Nvidia dominent actuellement la formation et l'inférence de l'IA, et les challengers concluent de plus en plus qu'il est difficile de battre de front l'opérateur historique sur une seule architecture. Business Insider a présenté l'accord alors qu'AMD s'en prenait à Nvidia en pariant sur l'inférence, la phase de l'informatique IA qui devrait connaître la croissance la plus rapide à mesure que les modèles passent du développement à la production.
Pour AMD, le partenariat avec Cerebras élargit l'attrait de sa feuille de route Instinct et Helios au-delà de la formation. Pour Cerebras, qui est coté au Nasdaq sous le symbole CBRS aux côtés d'AMD (NASDAQ : AMD), l'intégration avec un important fournisseur d'accélérateurs donne à sa technologie à l'échelle des tranches une voie plus claire vers les déploiements dans les grandes entreprises et dans le cloud. Cerebras prévoit de déployer AMD Helios dans ses propres centres de données, et les sociétés s'attendent à ce que la solution commune soit disponible d'abord via Cerebras Cloud au second semestre 2026.
Pourquoi la désagrégation est importante maintenant
Les coûts d’inférence sont devenus un point de pression déterminant pour l’industrie de l’IA. À mesure que les modèles grandissent et que les applications exigent des réponses en temps réel, le coût de génération de chaque jeton et la latence des utilisateurs en attente peuvent déterminer si un produit est viable. L'inférence désagrégée traite le pré-remplissage et le décodage comme des charges de travail distinctes qui peuvent être acheminées vers le matériel le mieux adapté à chacune, une philosophie de conception que des entreprises comme Cerebras défendent depuis plus d'un an.
L'annonce d'AMD-Cerebras suggère que cette approche passe d'une idée insurgée à une architecture approuvée par l'industrie. En associant un spécialiste du débit à un spécialiste de la latence, les deux sociétés font le pari que l’avenir de l’inférence ne réside pas dans une seule puce pour les gouverner tous, mais dans un système coordonné de moteurs spécialisés.
Que regarder
Plusieurs questions demeurent. Le chiffre de 5x jetons par seconde par watt est une attente plutôt qu'une référence tierce, et les performances réelles dépendront des modèles spécifiques et des charges de travail exécutés par les clients. Les détails sur les prix et la disponibilité au-delà du lancement de Cerebras Cloud n'ont pas été divulgués, et il n'est pas clair quand la solution pourrait atteindre d'autres fournisseurs de cloud.
Pourtant, l’accord souligne un changement plus large dans le matériel d’IA : l’hypothèse selon laquelle une architecture GPU unique servirait chaque étape du pipeline d’IA s’effiloche. Si AMD et Cerebras peuvent tenir leurs promesses d’efficacité, l’inférence désagrégée pourrait devenir un élément standard de la façon dont les plus grands systèmes d’IA sont construits.
Gardez une longueur d'avance sur l'IA
Le paysage du matériel d’IA se divise en camps spécialisés, et les implications en termes de coût, de vitesse et de concurrence sont énormes. Lire plus d'actualités sur l'IA sur AI Buzz Wire pour rester au courant de chaque offre, version et référence majeures.


