xAI a publié Grok 4.7, le modèle de codage et de connaissances le plus performant de l'entreprise à ce jour, après des semaines de taquineries publiques et au moins un retard. Annoncé dimanche sur le site de la société, le modèle arrive au même prix et à la même vitesse de service que son prédécesseur Grok 4.6 : 2 $ par million de jetons d'entrée et 6 $ par million de jetons de sortie, soit environ la moitié du prix catalogue du GPT-5.6 Sol Max d'OpenAI (4 $/20 $) et bien en dessous du Fable 5.1 Max d'Anthropic (10 $/50 $).

Pour les dernières nouvelles et analyses sur l’IA, visitez AI Buzz Wire.

Un modèle de base plus grand, formé pour de longues tâches

Selon l'annonce de xAI, Grok 4.7 utilise un nouveau modèle de base plus grand que Grok 4.6 et a été formé avec un apprentissage par renforcement plus long sur un mélange de tâches plus difficiles, axé sur des problèmes qui prennent plusieurs heures à résoudre. La société affirme que le modèle est plus efficace pour vérifier son propre travail et gérer un contexte plus long, et qu'il a été formé pour comprendre nativement le harnais Grok Bot, améliorant ainsi les tâches conversationnelles et le travail de connaissances générales.

La sortie fait suite à une montée en puissance bruyante. Elon Musk a d'abord déclaré début septembre que Grok 4.7 atterrirait d'ici dix jours, puis a reconnu à la mi-septembre que le modèle avait besoin de quelques jours supplémentaires pour être peaufiné, selon TeslaNorth.com. Il est maintenant disponible et GitHub a confirmé le même jour que Grok 4.7 est disponible dans GitHub Copilot.

L'image de référence : forte, pas radicale

Les données de référence publiées par xAI montrent un modèle qui est en tête dans plusieurs catégories à long terme tout en restant derrière la configuration la plus chère d'Anthropic dans d'autres :

  • CursorBench 4.0, qui met l'accent sur les tâches de codage de plus longue durée : Grok 4.7 obtient un score de 46,3 %, devant GPT-5.6 Sol Max (41,7 %) et Grok 4.6 High (40,4 %), mais derrière Fable 5.1 Max (51,8 %).
  • Terminal-Bench 4.0, travail de terminal sur plusieurs heures : 38,0 %, en forte hausse par rapport aux 20,3 % pour Grok 4.6 et juste devant GPT-5.6 Sol Max (37,3 %), bien que Fable 5.1 Max soit en tête à 57,9 %.
  • EEBench, une référence en génie électrique : 64,0 %, un bond important par rapport aux 53,0 % de Grok 4.6 et le plus élevé des modèles répertoriés.
  • DeepSWE v1.1 : 71,0 % à effort élevé, contre 65,2 % pour Grok 4.6 et 72,7 % pour GPT-5.6 Sol Max.
  • AA Briefcase v1.1, travail de bureau de plusieurs heures : 1 657, contre 1 546, et se rapproche de Fable 5.1 Max à 1 678.
  • Harvey Legal Agent Benchmark : 19,6%, devant Grok 4.6 (15,8%) et loin devant GPT-5.6 Sol Max (2,5%) et Fable 5.1 Max (6,7%) sur cette mesure.
  • HealthBench Professional : 56,7 %, en amélioration par rapport aux 48,5 % de Grok 4.6 mais derrière GPT-5.6 Sol Max (60,5 %) et Fable 5.1 Max (62,1 %).

Sur GDPval, une référence professionnelle en matière de travail de connaissances évaluée par Elo, le graphique de xAI place Grok 4.7 à un raisonnement xélevé sur 1 695 – contre 1 605 pour Grok 4.6, derrière Fable 5.1 Max (1 735) et devant GPT-6 Astra Max (1 542).

Le prix est l'histoire

L'affirmation la plus agressive de l'annonce est économique plutôt que technique : xAI décrit le Grok 4.7 comme deux fois plus rapide à la moitié du prix des modèles comparables, et le tableau de prix publié conforte la comparaison avec les configurations haut de gamme de ses deux principaux rivaux. Le prix du jeton 2 $/6 $ de Grok 4.7 est inchangé par rapport à Grok 4.6, ce qui signifie que les acheteurs bénéficient d'une amélioration de génération en génération sans augmentation de prix.

Ce positionnement étend une stratégie que xAI a poursuivie à travers la gamme Grok 4.x : égaler ou approcher la qualité de pointe tout en réduisant les niveaux de prix premium d'OpenAI et d'Anthropic, puis distribuer de manière agressive via des partenaires tels que GitHub, Cursor et OpenRouter.

Que regarder

La mise en garde honnête est que xAI a publié lui-même le tableau de comparaison et qu’une vérification indépendante par des agrégateurs d’analyse comparative prendra des jours. Sur les chiffres que xAI a choisi de souligner, Grok 4.7 est une véritable avancée par rapport à Grok 4.6 – plus visiblement sur Terminal-Bench 4.0 et EEBench – mais il ne balaie pas Fable 5.1 Max, qui conserve la tête en matière de codage et de références de santé tout en coûtant cinq fois plus cher par jeton de sortie.

Pour les développeurs exécutant des charges de travail agents longues et de plusieurs heures, le calcul prix-performance peut être plus important que la position brute dans le classement. Grok 4.7 est désormais disponible via l'API de xAI et dans GitHub Copilot.

Gardez une longueur d'avance sur l'IA

Pour une couverture continue des développements les plus importants de l'industrie de l'IA, ajoutez AI Buzz Wire à vos favoris et ne manquez jamais une actualité de dernière minute.

Lire plus d'actualités sur l'IA