xAI hat Grok 4.7 veröffentlicht, das bislang leistungsfähigste Modell des Unternehmens für Codierung und Wissensarbeit, nach wochenlangen öffentlichen Neckereien und mindestens einer Verzögerung. Das Modell wurde am Sonntag auf der Website des Unternehmens angekündigt und erreicht den gleichen Preis und die gleiche Bereitstellungsgeschwindigkeit wie sein Vorgänger Grok 4.6: 2 US-Dollar pro Million Input-Tokens und 6 US-Dollar pro Million Output-Tokens, etwa die Hälfte des Listenpreises von OpenAIs GPT-5.6 Sol Max (4 US-Dollar/20 US-Dollar) und deutlich unter dem Fable 5.1 Max von Anthropic (10 US-Dollar/50 US-Dollar).
Die neuesten KI-Nachrichten und Analysen finden Sie unter AI Buzz Wire.
Ein größeres Basismodell, trainiert für lange Aufgaben
Laut der Ankündigung von xAI verwendet Grok 4.7 im Vergleich zu Grok 4.6 ein neues, größeres Basismodell und wurde mit einem längeren Reinforcement-Learning-Lauf auf einem schwierigeren Aufgabenmix trainiert, der auf Probleme ausgerichtet ist, deren Erledigung viele Stunden in Anspruch nimmt. Das Unternehmen gibt an, dass das Modell seine eigene Arbeit besser verifizieren und längere Kontexte verwalten kann und dass es darauf trainiert wurde, die Grok-Bot-Funktionsweise nativ zu verstehen, wodurch Konversationsaufgaben und allgemeine Wissensarbeit verbessert werden.
Der Veröffentlichung folgt ein lautstarker Anlauf. Elon Musk sagte erstmals Anfang September, dass Grok 4.7 innerhalb von zehn Tagen landen würde, räumte dann jedoch Mitte September ein, dass das Modell laut TeslaNorth.com noch ein paar Tage zur Verfeinerung benötige. Es wird jetzt ausgeliefert und GitHub bestätigte am selben Tag, dass Grok 4.7 in GitHub Copilot verfügbar ist.
Das Benchmark-Bild: Stark, nicht mitreißend
Die von xAI veröffentlichten Benchmark-Daten zeigen ein Modell, das in mehreren langfristigen Kategorien führend ist, in anderen jedoch hinter der teuersten Konfiguration von Anthropic zurückbleibt:
- CursorBench 4.0, das länger laufende Codierungsaufgaben betont: Grok 4.7 erreicht 46,3 %, vor GPT-5.6 Sol Max (41,7 %) und Grok 4.6 High (40,4 %), aber hinter Fable 5.1 Max (51,8 %).
- Terminal-Bench 4.0, mehrstündige Terminalarbeit: 38,0 %, ein deutlicher Anstieg von 20,3 % für Grok 4,6 und knapp vor GPT-5.6 Sol Max (37,3 %), obwohl Fable 5.1 Max mit 57,9 % führt.
- EEBench, ein Benchmark für Elektrotechnik: 64,0 %, ein großer Sprung gegenüber den 53,0 % von Grok 4.6 und das höchste der aufgeführten Modelle.
- DeepSWE v1.1: 71,0 % bei hohem Aufwand, gegenüber 65,2 % bei Grok 4.6 und 72,7 % bei GPT-5.6 Sol Max.
- AA Briefcase v1.1, mehrstündige Büroarbeit: 1.657, gegenüber 1.546 und knapp hinter Fable 5.1 Max mit 1.678.
- Harvey Legal Agent Benchmark: 19,6 %, vor Grok 4,6 (15,8 %) und weit vor GPT-5,6 Sol Max (2,5 %) und Fable 5,1 Max (6,7 %).
- HealthBench Professional: 56,7 %, eine Verbesserung gegenüber 48,5 % von Grok 4.6, aber Rückstand auf GPT-5.6 Sol Max (60,5 %) und Fable 5.1 Max (62,1 %).
Beim GDPval, einem von Elo bewerteten professionellen Wissensarbeits-Benchmark, beziffert das xAI-Diagramm Grok 4,7 mit xhigh-Werten auf 1.695 – gegenüber 1.605 für Grok 4.6, hinter Fable 5.1 Max (1.735) und vor GPT-6 Astra Max (1.542).
Der Preis ist die Geschichte
Die aggressivste Behauptung in der Ankündigung ist eher wirtschaftlicher als technischer Natur: xAI beschreibt Grok 4.7 als doppelt so schnell und halb so teuer wie vergleichbare Modelle, und die veröffentlichte Preistabelle untermauert den Schlagzeilenvergleich mit den Top-Konfigurationen seiner beiden Hauptkonkurrenten. Der Token-Preis von Grok 4.7 in Höhe von 2 $/6 $ ist gegenüber Grok 4.6 unverändert, was bedeutet, dass Käufer die Verbesserung von Generation zu Generation ohne Preiserhöhung erhalten.
Diese Positionierung erweitert eine Strategie, die xAI in der gesamten Grok 4.x-Reihe verfolgt hat: Spitzenqualität erreichen oder annähern und gleichzeitig die Premium-Preisstufen von OpenAI und Anthropic unterbieten und dann aggressiv über Partner wie GitHub, Cursor und OpenRouter vertreiben.
Was Sie sehen sollten
Der ehrliche Vorbehalt besteht darin, dass xAI die Vergleichstabelle selbst veröffentlicht hat und eine unabhängige Überprüfung durch Benchmarking-Aggregatoren Tage dauern wird. Was die Zahlen betrifft, die xAI hervorgehoben hat, ist Grok 4.7 ein echter Fortschritt gegenüber Grok 4.6 – am sichtbarsten bei Terminal-Bench 4.0 und EEBench –, aber es übertrifft Fable 5.1 Max nicht, das bei Codierungs- und Gesundheits-Benchmarks die Führung behält und gleichzeitig fünfmal mehr pro Ausgabe-Token kostet.
Für Entwickler, die lange, mehrstündige Agenten-Workloads ausführen, ist das Preis-Leistungs-Verhältnis möglicherweise wichtiger als die bloße Position in der Bestenliste. Grok 4.7 ist ab sofort über die API von xAI und in GitHub Copilot verfügbar.
Bleiben Sie der KI immer einen Schritt voraus
Für eine kontinuierliche Berichterstattung über die wichtigsten Entwicklungen der KI-Branche setzen Sie ein Lesezeichen auf AI Buzz Wire und verpassen Sie keine aktuelle Meldung.
Weitere KI-Neuigkeiten lesen