Advanced Micro Devices a conclu un accord définitif pour acquérir Taalas, une startup basée à Toronto qui connecte des modèles d'intelligence artificielle directement dans le silicium, dans le but d'accélérer considérablement l'inférence de l'IA. L'accord, annoncé le 6 août 2026, intervient quelques semaines seulement après qu'AMD a signé un accord séparé avec Cerebras et signale une volonté agressive de contester la domination de Nvidia dans le matériel d'IA.

Cette acquisition reflète la rapidité avec laquelle le paysage des semi-conducteurs évolue, alors que les entreprises recherchent des moyens moins coûteux et plus rapides d’exécuter des modèles d’IA. Pour la couverture continue de l'industrie de l'IA sur la guerre des puces qui remodèle le domaine, AI Buzz Wire suit chaque mouvement majeur.

Ce que fait réellement Taalas

Taalas adopte une approche non conventionnelle du soi-disant mur de mémoire – le goulot d'étranglement où les GPU restent inactifs en attendant que les données arrivent de la mémoire avant de pouvoir commencer à analyser des chiffres. Au lieu de récupérer les poids d'un modèle à partir d'une banque de mémoire distincte, Taalas câble physiquement ces poids dans des transistors individuels.

L'architecture numérique propriétaire de la startup peut stocker 4 bits de données et exécuter des opérations mathématiques à l'aide d'un seul transistor. Sa puce HC1 comporte des blocs matériels partagés qui précalculent en permanence les 16 produits possibles pour un poids de modèle quantifié de 4 bits. Étant donné que tous les résultats mathématiques possibles se produisent déjà en direct sur la puce, chaque transistor agit comme un routeur physique plutôt que comme une calculatrice.

Chaque poids spécifique du modèle AI est représenté par un seul transistor Mask ROM. Lors de la fabrication, une couche métallique microscopique est gravée pour connecter physiquement ce transistor à l'une des 16 lignes de produits précalculées. Lorsque les données circulent à travers la puce, le transistor sélectionne simplement le bon canal précalculé et transmet le résultat à un additionneur. Essentiellement, le circuit est à la fois la mémoire et le processeur combinés.

Le résultat, selon l'entreprise, est stupéfiant : la puce HC1 peut générer environ 16 000 à 17 000 jetons par seconde et par utilisateur. L'approche rappelle le Groq LPU, qui intègre de la même manière les poids du modèle d'IA directement dans la SRAM rapide sur puce pour contourner le goulot d'étranglement de la mémoire.

The Catch : une puce conçue pour un seul modèle

Le compromis est important. Étant donné que les poids du modèle sont physiquement gravés dans le silicium, chaque puce Taalas fonctionne uniquement pour le modèle d'IA spécifique pour lequel elle a été conçue. Ce n’est pas un accélérateur programmable à usage général. Cela en fait une proposition fondamentalement différente d’un GPU, qui peut exécuter n’importe quel modèle chargé dans sa mémoire.

Les analystes du secteur ont émis l'hypothèse que la technologie de Taalas pourrait servir d'accélérateur de décodage dédié au sein des systèmes rackables plus larges d'AMD - gérant la deuxième phase d'inférence sensible à la latence - tandis qu'un matériel plus flexible comme le système Helios alimenté par Cerebras gère la phase de pré-remplissage. AMD n'a pas encore précisé exactement où les puces de Taalas s'intégreront dans sa feuille de route produit.

Qui a construit les Taalas

Taalas a été fondée en 2023 par un trio d'anciens employés d'AMD et dirigeants de Tenstorrent, le fabricant de puces IA fondé à Toronto et désormais basé à Santa Clara. L'équipe fondatrice comprend le PDG Ljubisa Bajic, co-fondateur et ancien directeur général, directeur de la technologie et président de Tenstorrent ; la directrice de l'exploitation Lejla Bajic ; et le directeur technique Drago Ignjatovic.

La société est sortie de la furtivité en 2024, révélant un financement de 50 millions de dollars de la part de Quiet Capital et de l'investisseur chevronné des semi-conducteurs Pierre Lamond, entre autres. Plus tôt en 2026, il a annoncé un montant supplémentaire de 169 millions de dollars provenant d'un groupe comprenant Fidelity. Taalas a affirmé pouvoir lancer une nouvelle puce personnalisée en seulement deux mois, par rapport à une norme industrielle qui s'étend souvent sur un ou deux ans, et a parié qu'elle pourrait produire du matériel mille fois plus efficace que ses homologues logiciels.

Les conditions financières de l'acquisition d'AMD n'ont pas été divulguées. La transaction reste soumise aux conditions de clôture et à l'approbation réglementaire.

Pourquoi AMD achète maintenant

AMD a décrit Taalas comme un pionnier du silicium d'inférence d'IA spécialisé dont la technologie optimise les flux de données d'inférence d'IA et réduit considérablement les goulots d'étranglement de calcul et de mémoire associés aux architectures à usage général.

« La technologie de Taalas et l'équipe d'ingénierie de classe mondiale renforcent notre portefeuille d'IA en offrant des performances et une efficacité d'inférence différenciées », a déclaré Vamsi Boppana, vice-président senior d'AMD de son groupe IA, dans un communiqué de presse.

L’accord étend un modèle plus large. L'accord antérieur d'AMD avec Cerebras intègre le moteur Wafer-Scale Engine de ce dernier dans le prochain système à l'échelle du rack Helios, qui place une énorme quantité de mémoire et de calcul sur une seule feuille de silicium interconnectée. L'ajout de Taalas donne à AMD une troisième arme distincte dans son arsenal d'inférence, aux côtés de ses propres GPU Instinct et du partenariat Cerebras.

Pour AMD, l’attrait est clair. Nvidia continue de dominer la formation et l'inférence de l'IA avec son écosystème GPU, et ses concurrents ont du mal à rivaliser sur le calcul à usage général. En acquérant des sociétés avec des architectures fondamentalement différentes – moteurs à l’échelle d’une tranche, modèle de silicium câblé – AMD parie que le matériel spécialisé se taillera des niches lucratives que les GPU universels de Nvidia ne peuvent pas servir aussi efficacement.

Le marché de l'inférence en évolution

L’acquisition témoigne également d’un changement plus large dans l’industrie. À mesure que les modèles d’IA grandissent et que les coûts d’inférence explosent, la rentabilité de leur exécution sur des GPU à usage général est mise sous pression. Les puces d'inférence spécialisées promettent des réductions de coûts considérables pour les déploiements à grand volume, où le même modèle est exécuté des millions de fois.

Si AMD parvient à commercialiser avec succès l'approche câblée de Taalas, elle pourrait offrir aux fournisseurs de cloud et aux entreprises un moyen d'exécuter des modèles populaires à une fraction du coût et de la latence des GPU traditionnels, à condition qu'ils soient prêts à s'engager dans un silicium construit autour d'un modèle unique.

Gardez une longueur d'avance sur la guerre des puces

La bataille pour la suprématie matérielle de l’IA s’intensifie, chaque acquisition refaçonnant l’équilibre des pouvoirs. Suivez nos derniers développements en matière d’IA pour une analyse approfondie du silicium qui pilote la prochaine génération d’intelligence.

Lire plus d'actualités sur l'IA →