Open-Weight-KI-Modelle schließen die Lücke zu Closed-Frontier-Modellen in beeindruckendem Tempo: Laut einer neuen Analyse des Halbleiterforschungsunternehmens SemiAnalysis brauchen offene Modelle mit jeder weiteren Ära großer Sprachmodelle nur halb so lange, um zum ersten geschlossenen Modell dieser Ära aufzuschließen.
Die Studie mit dem Titel „Haben offene Modelle aufgeholt?“ und am 21. August von Evan Cloutier, Max Kan, Jordan Nanos und Dylan Patel veröffentlicht, ist einer der bisher systematischsten Versuche, eine Frage zu quantifizieren, die die gesamte KI-Branche beschäftigt: Wenn offene Modelle zu einem Bruchteil der Kosten nahezu so leistungsfähig bleiben wie die geschlossenen Grenzlabore, haben Grenzlabore dann ein dauerhaftes Geschäft? Für eine ausführliche Berichterstattung über die Modellveröffentlichungen, die diesen Wandel vorantreiben, folgen Sie AI Buzz Wire.
Drei Äras der Frontier-KI
Die Autoren argumentieren, dass die Geschichte von LLMs in drei verschiedene Epochen unterteilt ist – frühe Skalierung, Argumentation und Agentie –, die jeweils eine Stufenfunktionssteigerung dessen darstellen, was Modelle sinnvoll leisten können.
Ihr zentraler methodischer Punkt ist, dass der Vergleich von Modellen verschiedener Epochen mit einem einzigen Benchmark ein Fehler ist. Jeder Benchmark ist ein Produkt seiner Zeit: Er wurde entwickelt, um die zu diesem Zeitpunkt vorhandenen Leistungsunterschiede zu erkennen, und wird dann von Modellbauern erklommen, bis er seinen Sättigungsgrad erreicht. An diesem Punkt hört die Branche auf, sich darum zu kümmern und geht weiter. Stattdessen führte das SemiAnalysis-Team kuratierte Benchmark-Sets für die Modelle jeder Epoche durch, um eine zusammengesetzte Fähigkeitsbewertung zu erstellen.
Aus dieser Sicht bewegt sich die Lücke zwischen offen und geschlossen in Zyklen. Zu Beginn jeder Ära schließt ein Grenzlabor vielversprechende Forschungen ab, trainiert ein beeindruckendes Modell und macht einen Sprung nach vorne. Andere Labore identifizieren dann die wichtigsten Fortschritte, entwickeln sie zurück und schließen die Lücke. „Nichts bleibt für immer geheim – vor allem, wenn man die Destillation mit einbezieht“, schreiben die Autoren. „Es ist nur eine Frage, wie lange es dauert.“
Ihre Messung dieser Frage führte zum Hauptergebnis der Studie: Mit jeder Generation brauchen Open-Source-Modelle halb so lange, um mit dem ersten Closed-Source-Modell der Ära gleichzuziehen.
Warum sich dieser Zyklus anders anfühlt
Der Bericht geht unverblümt auf den Unterschied zwischen vergangenen und aktuellen Open-Model-Momenten ein. Der „DeepSeek-Moment“ im Januar 2025 sorgte für Schlagzeilen, aber „niemand nutzte R1 tatsächlich, um wirtschaftlich wertvolle Arbeit zu leisten“, stellen die Autoren fest.
Im Gegensatz dazu weisen sie darauf hin, dass Modelle wie GLM 5.3 und Kimi K3 „wirklich in der Lage sind, viele der gleichen Codierungs- und Agentenaufgaben zu bewältigen, die Anthropic auf über 65 Milliarden US-Dollar ARR gebracht haben“ – ein Hinweis auf die Umsatzentwicklung, die Codierungs- und Agenten-Workloads für den Claude-Hersteller vorangetrieben haben. Dieser Anspruch hat besonderes Gewicht, da es sich bei diesen offenen Modellen nicht nur um Demoware handelt; Sie werden in der Produktion für dieselben Aufgaben eingesetzt, die für geschlossene Labore echte Einnahmen generieren.
Die Nutzungszahlen verstärken den Wandel. Fireworks, ein Inferenzanbieter, der viele offene Modelle bedient, verarbeitet derzeit mehr als 40 Billionen Token pro Tag – doppelt so viel wie die API von OpenAI Ende März, so SemiAnalysis. Es ist, wie der Bericht es ausdrückt, „eine aufregende Zeit, um ein Token-Konsum zu sein“, da der Kampf um Token mittlerweile weit über das Duopol OpenAI–Anthropic hinausgeht.
Die Frage der Kommerzialisierung
Die Studie geht direkt auf die Befürchtung ein, die in manchen Ecken als FUD bezeichnet wird, dass leistungsfähige, billige offene Modelle die Modellebene vollständig zur Ware machen würden, ein Ergebnis, das für die Margen von Grenzlaboren katastrophal wäre.
Der öffentliche Teil der Analyse gibt keine vollständige Antwort und verweist die Leser auf das kostenpflichtige Tokenomics-Modell des Unternehmens für eine detaillierte Behandlung der Finanzdaten von OpenAI und Anthropic. Aber die Richtung ist klar: Wenn die offenen Modelle jeder Ära in der Hälfte der Zeit eintreffen wie die der vorherigen Ära, wird das Zeitfenster, in dem geschlossene Labore Premiumpreise für Grenzfähigkeiten verlangen können, immer kleiner.
Die Autoren warnen auch davor, den Trend als Todesurteil für die Pionierforschung zu interpretieren. Benchmarks, so schreiben sie, „erzählen nicht die ganze Geschichte“, und die Schlussfolgerungen des Berichts werden als „weniger pessimistisch“ in Bezug auf Grenzmodelle beschrieben, als die Leser zunächst vielleicht denken – zum Teil, weil die reine Benchmark-Parität nicht dasselbe ist wie die Parität in Bezug auf Zuverlässigkeit, Produktintegration, Unternehmensverteilung oder das Kapital, das für die Bereitstellung von Modellen in großem Maßstab erforderlich ist.
Warum es wichtig ist
Für Käufer bestätigen die Ergebnisse eine Strategie, die viele Unternehmen bereits übernommen haben: Standardmäßig auf offene oder günstigere Modelle für den Großteil des Token-Volumens zurückgreifen, während geschlossene Premium-Modelle für die schwierigsten Aufgaben reserviert werden. Für die Labore quantifiziert es den Druck, dem sie an zwei Fronten ausgesetzt sind – offene Modelle unten und enorme Rechenkosten oben.
Und für das Open-Source-Ökosystem bieten die SemiAnalysis-Daten etwas, das oft Mangelware war: Beweise und nicht Ideologien dafür, dass sich die Lücke nach einem vorhersehbaren Zeitplan schließt. Wenn das Halbzeitmuster auch in der nächsten Ära der Grenz-KI anhält, ist die wichtigste Frage der Branche nicht, ob offene Modelle aufholen, sondern was danach noch vertretbar bleibt.
Verfolgen Sie das Open-Weight AI Race Weitere KI-Neuigkeiten lesen →