xAI a publié Grok 4.6, la dernière itération de son modèle de langage à grande échelle, obtenant un score de 61 sur l'indice d'intelligence analytique artificielle pour correspondre au GPT-5.6 Sol d'OpenAI. Le modèle a été lancé aujourd'hui et est disponible immédiatement dans Cursor et Grok Build, avec un accès API et des intégrations de partenaires via OpenRouter, Vercel et Cloudflare.
Pour les dernières nouvelles et analyses sur l’IA, visitez AI Buzz Wire.
Frontier Intelligence à une fraction du coût
Selon Artificial Analysis, une plateforme d'analyse comparative indépendante, Grok 4.6 gagne cinq points par rapport à son prédécesseur Grok 4.5 sur l'Intelligence Index, ramenant xAI au niveau frontière aux côtés d'OpenAI. Le modèle se situe juste derrière Claude Opus 5 (63) et Claude Fable 5 (62) d'Anthropic, et devant Kimi K3.
Ce qui rend Grok 4.6 particulièrement remarquable, c'est son prix. Le prix global reste inchangé par rapport à Grok 4.5 à 2 $ par million de jetons d'entrée et 6 $ par million de jetons de sortie. Cela le place de plus de 60 % en dessous de Claude Opus 5 (5 $/25 $) et GPT-5.6 Sol (5 $/30 $). Le coût mesuré par tâche est de 0,84 $, ce qui le place sur la frontière Intelligence/Coût de Pareto.
Maintenir les prix à un niveau stable sur une génération est inhabituel à la frontière, où les gains en matière d’intelligence s’accompagnent généralement d’augmentations de prix. Grok 4.6 offre un gain d'indice d'intelligence de cinq points à un prix inchangé.
Conçu pour les agents de longue durée
Grok 4.6 s'appuie sur Grok 4.5 avec ce que xAI décrit comme un accent particulier sur les agents de longue durée et un travail interactif et visuel plus ambitieux. La société affirme que le modèle s'en tient à des tâches complexes à travers de nombreuses étapes, qu'il s'agisse de rechercher un sujet, d'analyser des informations, de travailler sur une base de code ou de transformer une idée en une application raffinée.
Les benchmarks agents racontent une histoire fascinante. Sur GDPval-AA v2, une mesure leader du travail de connaissances agentiques dans le monde réel, Grok 4.6 atteint un Elo de 1753, derrière seulement Claude Opus 5 et statistiquement à égalité avec Claude Fable 5 et Qwen3.8 Max. Il obtient un score de 50,7 % sur la référence bancaire tau-cubed pour le service client multi-tours, le plaçant parmi les deux premiers aux côtés de Qwen3.8 Max.
Sur CursorBench v3.2, Grok 4.6 obtient un score de 69,9 %, devant GPT-5.6 Sol (67,2 %) et Grok 4.5 (66,7 %). Il affiche 65,9% sur DeepSWE v1.1 et 61,3% sur FrontierCode v1.1 Extended.
Efficacité de virage remarquable
L'une des découvertes marquantes de l'analyse artificielle est le profil d'efficacité de Grok 4.6 sur AA-Briefcase, une référence privée de tâches de travail de connaissances agentiques à long terme. Le modèle débute avec un Elo de 1577, le plaçant au niveau Fable 5.
Les chiffres d’efficacité sont frappants. Grok 4.6 résout les tâches en environ 53 tours et 0,5 milliard de jetons d'entrée en moyenne, contre environ 103 tours et 2,0 milliards de jetons d'entrée pour Claude Opus 5 max. Étant donné que le travail agentique à long terme accumule rapidement le contexte, un modèle qui atteint une réponse comparable en deux fois moins de tours et un quart des jetons d'entrée présente un avantage en termes de coût bien au-delà de son prix par jeton.
Formation et sécurité
Grok 4.6 a subi une formation supplémentaire plus longue que Grok 4.5, avec des données générées par un modèle pour le raisonnement et des concepts techniques avancés, des données d'ingénierie de haute qualité, ainsi qu'un optimiseur et une recette de formation améliorés. xAI a utilisé Grok 4.5 pour régénérer les trajectoires SFT à travers les efforts de raisonnement, les harnais d'agents et les domaines tels que STEM, le génie logiciel et le travail de connaissances.
Le modèle comporte une fenêtre contextuelle de 500 000 jetons, inchangée par rapport à Grok 4.5. xAI rapporte que Grok 4.6 a subi sa plus vaste suite de tests préalables au déploiement pour les capacités et l'étalonnage des garanties, ainsi que de nombreux tests post-déploiement et tiers.
Disponibilité et prix
Grok 4.6 est disponible aujourd'hui dans Cursor et Grok Build. xAI propose une double utilisation incluse sur les deux plates-formes pendant la première semaine. Le prix commence à 2 $ par million de jetons d'entrée et à 6 $ par million de jetons de sortie, avec une variante rapide disponible à deux fois le prix. Les accès au cache sont réduits à 0,50 $ par million de jetons.
La version poursuit un rythme rapide pour xAI, avec Grok 4.6 arrivant un peu plus d'un mois après Grok 4.5. Le modèle positionne xAI comme un concurrent sérieux dans la course aux frontières, en particulier pour les développeurs privilégiant les performances agentiques et la rentabilité.
Gardez une longueur d'avance sur l'IA
Pour une couverture continue des développements les plus importants de l'industrie de l'IA, ajoutez AI Buzz Wire à vos favoris et ne manquez jamais une actualité marquante.
Lire plus d'actualités sur l'IA