Nvidia a déclaré à certains de ses plus gros clients que les prix des serveurs contenant ses puces d'IA augmenteraient de plus de 15 % sur les systèmes livrés à partir de début 2027, selon Bloomberg – la deuxième augmentation majeure des prix en moins d'un an, qui s'ajoute aux hausses d'environ 30 % sur presque toutes les gammes de produits en juillet.

L’avertissement, communiqué par les fabricants de serveurs qui assemblent des systèmes pour les grands opérateurs de centres de données, arrive à un moment délicat pour le secteur de l’IA : les entreprises sont aux prises avec le coût de la construction massive d’infrastructures, et le marché de la mémoire – le moteur déclaré de cette augmentation – ne montre aucun signe de refroidissement. Nvidia devrait publier ses résultats trimestriels le 26 août, où les analystes attendent de nouveaux détails sur la demande, l'offre et les coûts. Pour plus de contexte sur cette histoire, consultez notre couverture de l'industrie de l'IA.

Quels systèmes sont concernés

Selon le rapport, l'augmentation s'appliquera aux serveurs construits autour des plates-formes phares Grace Blackwell de Nvidia et de sa prochaine génération Vera Rubin. Les hausses ne seront pas uniformes : l'ampleur de l'ajustement dépend de la génération de silicium Nvidia impliquée ainsi que de la quantité et de la configuration de la mémoire dans chaque système.

Les fabricants de serveurs desservant de grandes entreprises technologiques, notamment Microsoft, Google et Oracle, auraient commencé à informer leurs clients des prochains changements de prix pour les systèmes expédiés début 2027.

La mémoire est la coupable

Le principal facteur est l’augmentation du coût de la mémoire. Les systèmes d’IA hautes performances nécessitent d’énormes quantités de mémoire à large bande passante, et la demande liée à l’expansion des centres de données a fait grimper les prix des HBM et LPDDR5. Les fabricants de mémoire Samsung Electronics, SK Hynix et Micron Technology sont tous confrontés à une forte demande, car la capacité des semi-conducteurs est de plus en plus orientée vers la mémoire à large bande passante et d'autres produits informatiques avancés.

Gaurav Gupta, vice-président et analyste chez Gartner, a déclaré que ces augmentations reflètent les pressions exercées sur l'ensemble de la chaîne d'approvisionnement de l'IA, et pas seulement sur la RAM. « Les prix des mémoires augmentent, en particulier HBM et LPDDR5, mais il y a d'autres aspects, comme les plaquettes de fonderie de pointe, les emballages avancés et d'autres pénuries de composants », a-t-il déclaré à CIO.com, ajoutant que ces problèmes génèrent des délais de livraison plus longs, « ce qui se traduit généralement par des prix plus élevés ».

Et il ne s’attend pas à un soulagement prochainement. "Dans l'environnement actuel de forte demande et d'offre limitée, nous nous attendons à ce que cette situation perdure à court et moyen terme", a déclaré Gupta, ce qui signifie des coûts plus élevés à la fois pour les organisations déployant leurs propres serveurs et pour celles qui louent des ordinateurs dans le cloud.

Peu de choix pour les acheteurs

Pour les DSI, le calcul n’est pas attrayant. Les consultants et les analystes affirment que les entreprises n’ont d’autre choix que d’accepter que les prix des infrastructures d’IA continueront d’augmenter, et que changer de fournisseur – même si cela est possible – n’éviterait pas les augmentations, car les coûts de la mémoire et des composants affectent l’ensemble du marché.

Scott Bickley, chercheur chez Info-Tech Research Group, a affirmé que Nvidia absorbait en réalité une partie du coup. Ses calculs suggèrent que l’entreprise est probablement en train d’absorber une partie de ses propres coûts croissants et d’en répercuter seulement une fraction sur ses plus gros clients. Mais il a été franc sur l'effet de levier dont disposent les acheteurs : « Le coût de la charge de travail diminue par jeton tandis que les coûts sous-jacents du matériel et de l'infrastructure augmentent », a-t-il déclaré. "Si vous construisez directement vos propres clusters, il s'agit d'une évolution automatique vers une solution déjà extrêmement coûteuse. Si vous achetez votre propre matériel, vous devrez l'absorber. Vous n'allez pas négocier pour vous en sortir."

Il y a un côté positif souligné par Bickley : les prix par jeton pour les modèles d'IA semblent baisser, ce qui donne aux acheteurs un moyen de freiner l'inflation du matériel en concevant des charges de travail qui dépendent moins de la capacité de mémoire brute.

Tirer davantage de ce que vous possédez déjà

Cette stratégie – tirer davantage parti du matériel existant – est le point de convergence de plusieurs analystes. Bickley a souligné des techniques telles que le routage de modèles, la compression et le traitement par lots comme moyens d'augmenter l'utilisation des clusters déjà en service.

Flavio Villanustre, RSSI du groupe LexisNexis Risk Solutions, convient que la compression est fondamentalement un problème d'offre et de demande qui devrait se stabiliser une fois que la production de mémoire augmentera pour répondre à la demande induite par l'IA – mais il ne prévoit pas que cela se produise dans les prochains mois. Entre-temps, a-t-il noté, certains fournisseurs de modèles d’IA adaptent leurs modèles pour mieux fonctionner dans des environnements à mémoire limitée. Il a souligné le Gemma E4B de Google et des modèles similaires, qui utilisent une approche hiérarchique à plusieurs niveaux qui extrait uniquement les parties nécessaires d'un modèle en mémoire plutôt que de conserver l'intégralité du modèle dans la RAM.

Mike Wilkes, RSSI d'entreprise chez Aikido Security, a affirmé que les hausses de prix pourraient être bénéfiques si elles imposaient des architectures plus disciplinées. Les entreprises ont passé ces dernières années à traiter les jetons du modèle frontière comme un « utilitaire infiniment élastique », a-t-il déclaré – acheminant les charges de travail vers le modèle le plus important, que la tâche nécessite ou non un raisonnement au niveau frontière. L'architecture appropriée est de plus en plus hybride : elle réserve environ 10 % de la consommation aux modèles frontières sur les problèmes qui en ont réellement besoin, tout en poussant la classification, l'extraction, la synthèse et les actions de routine des agents vers des modèles de langage réduits et des modèles à poids ouvert exécutés sur une infrastructure contrôlée par l'entreprise.

"Cela donne aux DSI un levier contre les prix abusifs ou la fixation unilatérale des prix", a déclaré Wilkes.

Un signal d'inflation pour l'économie de l'IA

Cette augmentation est également un signal quant à la direction que prendront les coûts du boom de l’IA. À mesure que les prix des mémoires, des plaquettes et des emballages augmentent, l’inflation se propage des fabricants de puces aux fournisseurs de serveurs, en passant par les fournisseurs de cloud et, finalement, aux entreprises qui s’appuient sur l’IA. Avec le rapport sur les résultats de Nvidia attendu le 26 août, les acheteurs et les investisseurs surveilleront la part de cette pression sur les coûts que l'entreprise absorbe – et quelle part elle se répercute en aval.

---

Restez à la Pointe de l'IA

Les dernières actualités, analyses et percées en IA — au même endroit.

Lire plus d'actualités IA →