OpenAI veröffentlichte GPT-6.1 Sol am 29. September und stellte GPT-6 Sol nur sieben Tage nach der Einführung dieses Modells ein, so das unabhängige Benchmarking-Unternehmen Artificial Analysis. Der Tausch fiel mit der DevDay-Entwicklerkonferenz des Unternehmens zusammen, auf der CNET berichtete, dass die Teilnehmer neben den neu eingeführten Dots-Agenten und einer Reihe von Abonnementänderungen sofort mit der Nutzung von GPT-6.1 Sol beginnen könnten.

Ein siebentägiger Flaggschiff-zu-Flaggschiff-Austausch ist selbst nach den beschleunigten Maßstäben des Jahres 2026 ungewöhnlich, und die Benchmarks legen nahe, warum OpenAI schnell vorankam. Für eine kontinuierliche Berichterstattung über Modelleinführungen, Benchmark-Kämpfe und den damit verbundenen Preiskampf verfolgt AI Buzz Wire die wichtigen Entwicklungen, sobald sie stattfinden.

Ein messbarer Sprung in sieben Tagen

Artificial Analysis berichtet, dass GPT-6.1 Sol im Intelligence Index des Unternehmens 4 Punkte gegenüber GPT-6 Sol und 5 Punkte gegenüber GPT-5.6 Sol gewinnt und damit nur 1 Punkt unter GPT-6 Astra, dem leistungsfähigsten Modell von OpenAI, landet. Die Bewertung des Unternehmens vereint Argumentation, Wissensarbeit, Mathematik und Agentenaufgaben in einer einzigen Vergleichsbewertung.

Die Teilwerte zeigen, wo sich die Gewinne konzentrieren. GPT-6.1 Sol verbesserte sich um 4 Punkte in AA-Briefcase v1.1 und 5 Punkte in GDPval-AA v2.1, wobei beide Tests die Arbeit mit Agentenwissen testen. Ein 12-Punkte-Sprung in Terminal-Bench 4.0 deutet auf eine wesentlich bessere Leistung in realen Terminalumgebungen hin, während Humanity's Last Exam um 5 Punkte und GDP.pdf um 6 Punkte zulegte.

Eine Zahl fällt jedem auf, der Modelle für Forschungszwecke verwendet: Die Genauigkeit von AA-Omniscience stieg um 8 Punkte, während die Halluzinationsrate von 60 Prozent auf 54 Prozent sank. In absoluten Zahlen sind beide Zahlen nach wie vor hoch, aber die Richtung ist für Arbeitsabläufe wichtig, bei denen eine sichere falsche Antwort schlimmer ist als keine Antwort.

Gleicher Aufkleberpreis, in der Praxis günstiger

Was die Preisgestaltung betrifft, behält GPT-6.1 Sol die Preisliste von GPT-6 Sol bei, die 2 US-Dollar pro Million Eingabe-Tokens und 10 US-Dollar pro Million Ausgabe-Tokens vorsieht, aber der Cache-Leserabatt steigt von 90 Prozent auf 95 Prozent. Artificial Analysis stellt fest, dass der Gesamtpreis von GPT-6.1 Sol für Agenten-Workloads daher etwas niedriger ist als der von GPT-6 Sol, womit eine Reihe effektiver Preissenkungen fortgesetzt wird, die begann, als GPT-6 Sol mit einem Rabatt von 50 Prozent auf GPT-5.6 Sol auf den Markt kam.

Die Preisentwicklung ist hier die eigentliche Geschichte. Innerhalb von zwei Veröffentlichungen hat OpenAI die effektiven Kosten seiner Mid-Tier-Frontier-Linie zweimal ungefähr halbiert und dabei die Qualität jedes Mal verbessert.

Kosten pro Aufgabe: 0,72 $ gegenüber 3,26 $

Bei den Kosten pro Aufgabe wird der Abstand zum GPT-6 Astra deutlich. Bei maximalem Aufwand beziffert Artificial Analysis den GPT-6.1 Sol auf 0,72 US-Dollar pro Intelligence-Index-Aufgabe, weniger als ein Viertel der 3,26 US-Dollar für GPT-6 Astra. Im Vergleich zum eigenen Vorgänger liegen die Einsparungen bei 31 Prozent (1,05 US-Dollar für GPT-6 Sol) und im Vergleich zu GPT-5.6 Sol bei 64 Prozent (1,99 US-Dollar).

Nach Angaben des Unternehmens verschiebt jede Anstrengungsstufe von GPT-6.1 Sol die Kosteneffizienz-Pareto-Grenze – was bedeutet, dass es für eine bestimmte Intelligenzstufe keine günstigere Option unter den verfolgten Modellen gibt. Das Bild der Token-Effizienz ist gemischter: GPT-6.1 Sol verbraucht über alle Aufwandsstufen hinweg etwa 10 bis 30 Prozent mehr Ausgabe-Tokens als GPT-6 Sol, obwohl seine Einstellungen für niedrigen und mittleren Aufwand Pareto-optimal für die Token-Effizienz bleiben, wenn die höhere Intelligenz berücksichtigt wird. Beim Codieren gewann das Modell bei maximalem Aufwand im Coding Agent Index des Unternehmens 3 Punkte gegenüber GPT-6 Sol.

Warum die siebentägige Bearbeitungszeit wichtig ist

Das breitere Spektrum von DevDay verstärkt das gleiche Bild. Der CNET-Bericht umrahmte die Konferenz von drei Dingen, die Entwickler sofort nutzen könnten – GPT-6.1 Sol, die Dots-Agenten und überarbeitete Abonnementpläne – und nicht von einer fernen Forschungsvorschau. Die Botschaft an die Entwickler lautete: Verfügbarkeit heute, nicht Möglichkeit morgen.

Das Flaggschiff signalisiert mit diesem kurzen Signal, dass sich der Wettbewerbsdruck von Trainingsläufen auf die Verfeinerung nach dem Training und die Bereitstellung der Infrastruktur verlagert hat. Ein Upgrade auf Punktebene, das innerhalb einer Woche ausgeliefert wird, ähnelt eher einem optimierten Kontrollpunkt und einem neuen Preisblatt als einem völlig neuen Basismodell, und Konkurrenten verhalten sich genauso: Google kündigte am 30. September Gemini 4 Argon an, ein Grenzmodell, das zunächst vertrauenswürdige Cyber-Verteidiger über sein Fairwind-Programm zum gleichen Token-Preis von 2/10 US-Dollar pro Million erreicht.

Für Entwickler ergeben sich aus den verifizierten Zahlen drei praktische Erkenntnisse. Erstens profitieren Agenten-Workloads mit starker Cache-Wiederverwendung sofort vom Cache-Rabatt von 95 Prozent. Zweitens sollten Budgets den höheren Output-Token-Verbrauch vor der Migration modellieren, da der Preis pro Token unverändert bleibt, auch wenn das Modell länger denkt. Drittens bleibt Astra die Obergrenze für Aufgaben, bei denen der letzte Punkt der Intelligenz einen 4-fachen Kostenaufschlag wert ist – bei GPT-6.1 Sol ist dies bei den meisten Arbeiten nicht der Fall.

Der Vorbehalt muss wiederholt werden: Diese Zahlen stammen von einem einzigen unabhängigen Gutachter, wie streng seine Methodik auch sein mag, und die Indexwerte belohnen bestimmte Arbeitsbelastungsmischungen. Teams mit anspruchsvollen Arbeitslasten sollten ihre eigenen Auswertungen erneut durchführen, bevor sie den Produktionsverkehr umleiten.

---

Der KI einen Schritt voraus sein

Erhalten Sie die neuesten KI-Nachrichten, Analysen und Durchbrüche – alles an einem Ort.

Weitere KI-Neuigkeiten lesen →