OpenAI a publié les premiers résultats de référence pour Jalapeño, sa puce d'inférence personnalisée, et les chiffres sont frappants : sur le benchmark InferenceX de SemiAnalysis, le nouveau silicium a enregistré à la fois plus de jetons par utilisateur et plus de débit par kilowatt que les processeurs d'inférence de pointe actuellement disponibles - une comparaison qui inclut les systèmes Blackwell de Nvidia. Les résultats ont été présentés mardi lors de la conférence Hot Chips à Palo Alto, parallèlement à un aperçu technique détaillé de la façon dont la puce a été construite. Pour les lecteurs qui suivent la course au calcul qui sous-tend chaque version du modèle d'IA, il s'agit de l'un des points de données matériels les plus conséquents de l'année.
"En fin de compte, les résultats montrent une avancée très, très significative en termes de performances par rapport à l'état de l'art", a déclaré Richard Ho, responsable du matériel d'OpenAI, lors d'un appel à la presse rapporté par TechCrunch. "Jalapeño peut servir davantage de travail d'IA par unité de puissance, tout en renvoyant des réponses plus rapidement. Il est très efficace pour servir un grand nombre de clients, mais il peut également avoir une latence très faible."
Une puce conçue pour le pipeline d'inférence complet
Jalapeño a été dévoilé en juin 2026 en tant que premier silicium personnalisé d'OpenAI, développé en étroite collaboration avec Broadcom, avec les propres modèles d'IA d'OpenAI aidant au processus de développement de la puce. Le partenariat lui-même remonte à octobre 2025, lorsqu'OpenAI a présenté des plans pour un programme d'accélérateur personnalisé multigénérationnel aux côtés du géant des réseaux.
Ce qui différencie Jalapeño d'un GPU à usage général, selon OpenAI, c'est qu'il a été conçu de concert avec les modèles qu'il servira. Étant donné que l’entreprise contrôle l’ensemble de la pile (produits, modèles, puces et mémoire d’IA), ses ingénieurs ont pu attaquer des phases spécifiques du processus d’inférence qui provoquent souvent des frictions.
En particulier, Jalapeño est conçu pour minimiser les retards lors des phases de traitement de pré-remplissage et de communication, qui, selon OpenAI, constituent souvent des goulots d'étranglement lors de la diffusion de grands modèles de langage à grande échelle.
"Nous avons conçu Jalapeño pour minimiser les mouvements de données et les retards de communication", a écrit la société dans un article de blog présentant les résultats. "Cela signifie que l'état du modèle, y compris le cache KV utilisé lors de la génération d'une réponse, peut être explicitement placé et conservé local pendant que le système active la bonne combinaison de calcul, de mémoire et de réseau pour chaque phase d'inférence."
Ce dernier point est important pour quiconque exécute des charges de travail d’IA en production. Le cache KV (le contexte accumulé qu'un modèle contient lors de la génération d'une réponse) est l'un des plus gros problèmes de mémoire et de bande passante dans l'inférence moderne. Le conserver local et explicitement géré, plutôt que de le répartir sur un cluster, est un moyen classique de récupérer la latence et la puissance.
Mieux que Blackwell — Pour l'instant
La comparaison principale est par rapport à un système Nvidia Blackwell, actuellement le cheval de bataille de l'inférence d'IA de pointe. Une analyse indépendante publiée le même jour par SemiAnalysis, intitulée « OpenAI Jalapeño : Better than Nvidia Blackwell », est parvenue à une conclusion similaire sur les premiers résultats de la puce, et l'histoire est rapidement devenue l'un des articles les plus discutés sur Hacker News.
Mais les dirigeants et les analystes d’OpenAI appellent à la prudence. Ho a estimé que Jalapeño serait déployé fin 2026 « en très petits volumes », avec un déploiement plus important en 2027. Au moment où Jalapeño atteindra sa pleine échelle, la concurrence aura peut-être considérablement progressé – la feuille de route de Nvidia continue d'évoluer et d'autres hyperscalers, notamment Google, Amazon et Microsoft, poussent tous leur propre silicium personnalisé.
Comme l'a noté TechCrunch, les références mesurées par rapport à l'état actuel de la technique ne sont qu'un instantané et non une garantie. Une puce qui gagnera en efficacité en 2026 doit continuer à gagner contre tout ce que Nvidia et ses concurrents proposeront l'année prochaine.
Pourquoi OpenAI construit son propre silicium
La logique stratégique est simple : l'inférence est le coût récurrent le plus important d'OpenAI. Chaque requête ChatGPT, chaque appel d'API et chaque tâche agent brûle du calcul, et la location de ce calcul auprès de Nvidia aux prix du marché réduit les marges à mesure que l'utilisation évolue. Une puce personnalisée adaptée aux propres modèles d'OpenAI – conçue conjointement avec Broadcom et façonnée par les modèles d'OpenAI eux-mêmes – donne à l'entreprise un moyen de servir plus d'utilisateurs par watt et par dollar.
Jalapeño est également prévu comme une plate-forme multigénérationnelle plutôt que comme une pièce unique. OpenAI a annoncé son intention de développer ensemble des produits, des modèles, des puces et de la mémoire d'IA, afin que chaque génération de silicium soit co-optimisée avec les modèles qu'elle exécutera. Si les résultats de la première génération se maintiennent en production, le Jalapeño devient le modèle pour tout ce qui suit.
Les enjeux s’étendent au-delà d’OpenAI. La domination de Nvidia sur les accélérateurs d'IA constitue le goulot d'étranglement le plus important du secteur depuis trois ans, et chaque alternative crédible - qu'elle vienne de l'équipe TPU de Google, d'Amazon ou maintenant d'OpenAI - change le paysage des négociations pour tous ceux qui construisent une infrastructure d'IA. Nvidia elle-même aurait averti ses clients d'une hausse des prix de 15 % ou plus sur les serveurs IA en raison de l'augmentation des coûts de la mémoire, ce qui ne ferait qu'accentuer l'attrait des alternatives internes.
Ce qui vient ensuite
Pour l'instant, Jalapeño reste une pièce de pré-production avec des chiffres papier prometteurs. Le véritable test arrive fin 2026, lorsque les premiers petits volumes seront déployés, et surtout en 2027, lorsque OpenAI attend une ampleur significative. Des questions clés restent sans réponse : la fiabilité réelle à l'échelle du centre de données, le coût total de possession par rapport à la capacité louée de Blackwell et la question de savoir si l'avantage en termes d'efficacité survivra à la prochaine génération de Nvidia.
Pourtant, les premiers benchmarks marquent une étape importante : c'est la première fois qu'un des grands laboratoires d'IA démontre publiquement un silicium d'inférence personnalisé qui semble battre le meilleur de l'opérateur historique en termes d'efficacité. Pour une industrie qui a traité l’offre de Nvidia comme une bouée de sauvetage stratégique, il s’agit d’un véritable point d’inflexion.
---
Gardez une longueur d'avance sur l'IARecevez les dernières actualités, analyses et avancées en matière d'IA, le tout en un seul endroit.
Lire plus d'actualités sur l'IA →