Cerebras und OpenAI haben der Welt einen ersten Einblick in den Ultrafast Mode gegeben, eine neue Serviceebene, die zuerst in der OpenAI-API startet und auf Cerebras-Hardware basiert. Laut der Cerebras-Ankündigung vom 13. August 2026 liefert GPT-5.6 Sol auf Ultrafast bis zu 750 Ausgabe-Tokens pro Sekunde – ohne Kompromisse bei der Qualität.

Die Stufe steht zunächst einer ausgewählten Kundengruppe zur Verfügung, wobei der Zugang im Laufe der Zeit erweitert wird. Die von Joyce Er von Cerebras verfasste Ankündigung positioniert das Angebot als Lösung für einen Kompromiss, der die Entwicklung von KI-Produkten seit Jahren bestimmt: Entwickler mussten sich zwischen Geschwindigkeit und Intelligenz entscheiden, da größere und intelligentere Modelle höhere Rechen- und Datenbewegungskosten verursachen, die die Reaktionszeiten verlangsamen. Leser, die den Wettlauf um die Beschleunigung von Grenzmodellen verfolgen, können die neuesten Entwicklungen auf AI Buzz Wire verfolgen.

Wie schnell ist Ultraschnell genau?

Allein schon die reine Durchsatzzahl ist beeindruckend, aber Cerebras lieferte auch einen Vergleichskontext. Laut den von Artificial Analysis, einem unabhängigen Benchmarking-Dienst, gemeldeten Ausgabegeschwindigkeiten läuft GPT-5.6 Sol im Ultrafast-Modus wie folgt:

  • 11x schneller als Fable 5
  • 5x schneller als Opus 4.8 im Schnellmodus

Um die Behauptung einem Stresstest zu unterziehen, ließ Cerebras das Modell im Rahmen des Humanity's Last Exam (HLE) gegen beliebte Konkurrenten antreten, einem herausfordernden Benchmark, der aus 2.500 Fragen besteht, die normalerweise nur von Personen mit einem Doktortitel in Bereichen wie Chemie, Wirtschaft und Literatur beantwortet werden können.

Das Ergebnis: GPT-5.6 Sol auf Ultrafast beantwortete alle 2.500 HLE-Fragen in 11 Stunden und 11 Minuten. Claude Fable 5 benötigte 78 Stunden und 27 Minuten – mehr als drei Tage ununterbrochener Berechnung –, um zu den gleichen Schlussfolgerungen zu gelangen. Mit anderen Worten: Ultrafast hat an einem einzigen Arbeitstag die Grenzen des menschlichen Wissens durchbrochen und eine vergleichbare Genauigkeit fast siebenmal schneller erreicht.

Cerebras verwies auf seine Benchmarking-Methodik: GPT-5.6 Sol Ultrafast wurde am 10. Juli mit Codex auf xhigh-Argumentation getestet, während Claude Fable 5 vom 13. bis 15. Juli mit Claude Code auf xhigh-Argumentation getestet wurde.

Arbeitslasten aus der Praxis, nicht nur Benchmarks

Geschwindigkeits-Benchmarks können irreführend sein, wenn sich dabei die Qualität verschlechtert. Aus diesem Grund hat Cerebras auch Ergebnisse zum BIP-Val hervorgehoben, einem Benchmark für wirtschaftlich wertvolle Wissensarbeitsaufgaben. Laut Tests, die Cerebras am 31. Juli 2026 mit GPT-5.6 Sol und GPT-5.6 Sol Ultrafast auf mittlerer Argumentation innerhalb von Codex durchführte, lieferte Ultrafast beim GDP-Val eine 5,6-fache End-to-End-Beschleunigung ohne Qualitätsverlust.

Das Unternehmen sagt, dass GPT-5.6 Sol das bisher beste Modell von OpenAI für rechtliche Unterlagen, Finanzmodelle und technische Berichte ist – Bereiche, in denen sowohl die Ausgabequalität als auch die Bearbeitungszeit direkte finanzielle Konsequenzen haben.

Warum Geschwindigkeit die Agentengleichung verändert

Die folgenschwerere Veränderung könnte in der Arbeitsweise von KI-Agenten liegen. Schnellere Schlussfolgerungen verändern die Möglichkeiten für Einzelpersonen und Organisationen, da Agenten auf den kritischen Pfad von Problemen gebracht werden können, bei denen jede Sekunde zählt.

„Mit GPT-5.6 Sol Ultrafast ermöglicht Cerebras eine KI, die mit Ihrer Denkweise, Programmierung und Zusammenarbeit Schritt hält“, sagte Rohan Varma, Produkt bei OpenAI, in einer in der Ankündigung zitierten Erklärung. „Wir sind gespannt, wie sich Arbeitsabläufe und Anwendungen durch Ultrafast Inference verändern.“

Cerebras skizzierte mehrere Szenarien mit hohem Risiko, bei denen es auf die Beschleunigung ankommt:

Reaktion auf Vorfälle

Unternehmen, die Webdienste betreiben, können Ultrafast nutzen, um Produktionsausfälle zu lokalisieren und zu beheben, das Vertrauen der Kunden zu wahren, Umsatzeinbußen zu vermeiden und Ausfallminuten gemäß ihren SLAs einzusparen.

Cybersicherheit

Bei gegnerischen Cyberangriffen mit hohem Risiko müssen Sicherheitsteams böswillige Akteure schnell erkennen und darauf reagieren, um katastrophale Verluste einzudämmen – eine Aufgabe, bei der die Schlussfolgerungslatenz direkten Einfluss auf die Schadensbegrenzung hat.

Agentenproduktivität

Ultrafast ermöglicht neue Formen der Zusammenarbeit mit Agenten, indem es Einblicke und Aktualisierungen in Echtzeit liefert und so die Notwendigkeit eines Kontextwechsels zwischen parallelen Sitzungen verringert.

„Früher musste ich vielleicht ein paar Minuten warten, bis eine Aufgabe abgeschlossen ist, jetzt ist sie für mich erledigt, bevor ich überhaupt die Möglichkeit habe, den Kontext zu wechseln. Das macht mich viel produktiver“, sagte Jeffrey Wang, Forscher bei OpenAI, in der Ankündigung.

Die Strategie hinter der Partnerschaft

Für Cerebras stellt der Deal einen weiteren Meilenstein in seinen Bemühungen dar, die Beschleunigung im Wafer-Maßstab für KI-Inferenz zu kommerzialisieren. Für OpenAI fügt der Ultrafast-Modus seiner API eine Premium-Geschwindigkeitsstufe hinzu, und zwar zu einem Zeitpunkt, an dem die Inferenzlatenz zu einem Wettbewerbsvorteil geworden ist – insbesondere für Agentenanwendungen, die viele Modellaufrufe miteinander verketten, bei denen sich die Verzögerungen pro Aufruf zu Minuten Wartezeit summieren.

Die Unternehmen betrachten die Stufe als dauerhaften Vorsprung für Organisationen, die Frontier-KI nutzen, um schnell auf eingehende Informationen zu reagieren, und kombinieren dabei ultraschnelle Verarbeitung für zeitkritische Arbeiten mit Standardverarbeitung für Standardaufgaben, die im Hintergrund parallelisiert werden können.

Der Zugang wird schrittweise eingeführt. Interessierte Entwickler können die Verfügbarkeit der OpenAI-API-Dokumentation überwachen, da laut Cerebras der Zugriff im Laufe der Zeit für die zunächst ausgewählte Kundengruppe erweitert wird.

Bleiben Sie der KI immer einen Schritt voraus

Für mehr Berichterstattung über den Hardware- und Infrastrukturwettlauf um die Neugestaltung künstlicher Intelligenz setzen Sie ein Lesezeichen auf AI Buzz Wire und folgen Sie unserem AI-Hardware-News-Feed.

Weitere KI-Neuigkeiten lesen →