Cerebras Systems und OpenAI haben einen ersten Einblick in den Ultrafast Mode gegeben, eine neue Servicestufe, die zuerst in der OpenAI-API eingeführt wird und auf der Wafer-Scale-Technologie von Cerebras basiert. Durch die Partnerschaft kann GPT-5.6 Sol mit bis zu 750 Ausgabe-Tokens pro Sekunde ausgeführt werden und liefert so Informationen auf Grenzniveau in Echtzeitgeschwindigkeit. Die neuesten Nachrichten zur KI-Hardware finden Sie unter AI Buzz Wire.

Beseitigung des Kompromisses zwischen Geschwindigkeit und Intelligenz

KI-Entwickler stehen seit langem vor einem grundlegenden Kompromiss: Je größer und intelligenter die Modelle werden, desto höher sind die Rechen- und Datenbewegungskosten, wodurch sich die Reaktionszeiten verlangsamen. Entwickler waren gezwungen, sich zu entscheiden, ob sie auf qualitativ hochwertige Ergebnisse warten oder schlechtere Ergebnisse in kürzerer Zeit akzeptieren wollten.

GPT-5.6 Sol im Ultrafast-Modus soll dieses Dilemma lösen. Laut Cerebras läuft der Dienst 11-mal schneller als Claude Fable von Anthropic und 5-mal schneller als Opus 4.8 im Schnellmodus, basierend auf den von Artificial Analysis gemeldeten Ausgabegeschwindigkeiten.

Die letzte Prüfung der Menschheit: Der Geschwindigkeitstest

Cerebras hat Ultrafast im Rahmen des Humanity's Last Exam (HLE) mit konkurrierenden Modellen auf die Probe gestellt, einem herausfordernden Benchmark, der aus 2.500 Fragen besteht, die normalerweise nur von Doktoranden in Bereichen wie Chemie, Wirtschaft und Literatur beantwortet werden können.

In von Cerebras durchgeführten Auswertungen beantwortete GPT-5.6 Sol im Ultrafast-Modus alle 2.500 HLE-Fragen in 11 Stunden und 11 Minuten. Claude Fable 5 benötigte 78 Stunden und 27 Minuten, also mehr als drei Tage ununterbrochener Berechnung, um zu den gleichen Schlussfolgerungen zu gelangen. Mit anderen Worten: Ultrafast hat die Grenzen des menschlichen Wissens in einem einzigen Arbeitstag bearbeitet und dabei eine vergleichbare Genauigkeit fast siebenmal schneller erreicht.

Das Benchmarking wurde von Cerebras unter Verwendung von GPT-5.6 Sol Ultrafast mit Codex bei hohen Reasoning-Einstellungen am 10. Juli und Claude Fable 5 mit Claude Code bei hohen Reasoning-Einstellungen vom 13. bis 15. Juli durchgeführt.

Auswirkungen auf das Geschäft in der Praxis

Beim GDP-Val, einem Maßstab für wirtschaftlich wertvolle Wissensarbeitsaufgaben, lieferte Ultrafast eine 5,6-fache End-to-End-Geschwindigkeit ohne Qualitätsverlust. Dies zeigt, wie eine schnellere Inferenz wirtschaftlich wertvolle Arbeit beschleunigen kann, ohne die Ausgabequalität zu beeinträchtigen.

Cerebras sieht Ultrafast als Werkzeug für Szenarien, in denen es auf jede Sekunde ankommt. Unternehmen, die Webdienste betreiben, könnten die Technologie nutzen, um Produktionsausfälle schneller zu erkennen und zu beheben, das Vertrauen der Kunden zu wahren und Umsatzeinbußen zu vermeiden. In kritischen Cybersicherheitssituationen könnten Sicherheitsteams Ultrafast nutzen, um Angriffe schnell zu erkennen und darauf zu reagieren.

Die Technologie hinter der Geschwindigkeit

Der Leistungsvorteil ergibt sich aus der Wafer-Scale-Engine-Architektur von Cerebras, die speziell für Grenz-KI-Arbeitslasten entwickelt wurde. Die zentrale Herausforderung der schnellen Frontier-Inferenz ist ein Datenbewegungsproblem: Bei herkömmlichen GPUs wird die Inferenz bei großen Modellen durch die Speicherbandbreite eingeschränkt, da Modellgewichte wiederholt zwischen On-Chip-Speicher und Off-Chip-Speicher übertragen werden müssen, um aufeinanderfolgende Token zu generieren.

Cerebras verfolgt einen grundlegend anderen Ansatz. Jeder Chip in Wafergröße enthält 44 GB SRAM direkt auf dem Silizium. Modellgewichte bleiben auf dem Chip und Token fließen ununterbrochen durch Modellschichten, die über Wafer verteilt sind. Dies eliminiert die ineffiziente Datenbewegung, die die GPU-basierte Inferenz verlangsamt, und skaliert reibungslos mit der Modellgröße, was den Weg für einen anhaltenden Geschwindigkeitsvorteil bei zukünftigen Grenzmodellen ebnet.

Verfügbarkeit und Marktpositionierung

GPT-5.6 Sol im Ultrafast-Modus ist derzeit in einer begrenzten Vorschau für eine ausgewählte Kundengruppe verfügbar, wobei der Zugriff mit der Zeit mit zunehmender Kapazität erweitert wird. Cerebras beschreibt die Partnerschaft als Anstoß für die nächste Welle der KI-Innovation und als Anhebung der Grenzen dessen, was Unternehmen mit reaktionsfähiger KI erreichen können.

Die Zusammenarbeit stellt einen bedeutenden Meilenstein für Cerebras dar, das seit langem Wafer-Scale-Computing als Alternative zum GPU-dominierten KI-Hardwaremarkt verfolgt. Durch die direkte Partnerschaft mit OpenAI zur Beschleunigung eines der leistungsfähigsten verfügbaren Grenzmodelle beweist Cerebras deutlich, dass seine Architektur einen echten Wettbewerbsvorteil für Hochgeschwindigkeits-Inferenz-Workloads bietet.

Da Modelle immer größer und intelligenter werden, könnte die Fähigkeit, sie mit Echtzeitgeschwindigkeit bereitzustellen, zu einem entscheidenden Wettbewerbsfaktor auf dem KI-Infrastrukturmarkt werden. Die Partnerschaft zwischen Cerebras und OpenAI zeigt, dass der Wettlauf um Inferenzgeschwindigkeit mittlerweile genauso wichtig ist wie der Wettlauf um Modellintelligenz.

Bleiben Sie der KI immer einen Schritt voraus

Für weitere KI-Hardware-Neuigkeiten, Modellleistungsanalysen und Branchenentwicklungen setzen Sie ein Lesezeichen auf AI Buzz Wire.

Weitere KI-Neuigkeiten lesen →