Das Qwen-Team von Alibaba hat am Mittwoch Qwen3.8-Flash-Next veröffentlicht, ein multimodales Experten-Mix-Modell, das gleichzeitig als Architekturvorschau des kommenden Qwen4 dient – ​​und das laut Angaben des Unternehmens Ergebnisse liefert, die sein viel größeres Qwen3.7-Plus bei etwa einem Neuntel der Schulungskosten übertreffen. Reuters, Bloomberg und The Decoder berichteten alle über den Start, der Hugging Face und ModelScope am selben Tag, an dem Z.ai sein eigenes grenzüberschreitendes offenes Modell auslieferte, in den Vordergrund rückte. Verfolgen Sie die aktuellen KI-Nachrichten, während das Open-Weight-Rennen an Fahrt gewinnt.

Eine neue Architektur im Kleinformat

Die wichtigste Spezifikation ist Effizienz. Qwen3.8-Flash-Next hat insgesamt 125 Milliarden Parameter, aktiviert aber nur 6 Milliarden pro Token. Zum Vergleich: Qwen3.7-Plus – das Modell, das es in den veröffentlichten Benchmarks von Alibaba übertrifft – hat insgesamt 397 Milliarden Parameter, wobei 17 Milliarden pro Token aktiviert sind, fast das Dreifache der aktiven Anzahl von Flash-Next.

Das technisch interessanteste Stück ist eine neuartige N-Gramm-Einbettungsschicht, die 51 Milliarden Parameter trägt. Die Schicht speichert gängige Wortgruppen als eigenständige Einträge in einer Art „Phrasenwörterbuch“, das Matthias Bastian von The Decoder beschrieben hat, und speist Informationen auf Phrasenebene in den Anfang des Netzwerks ein. Entscheidend ist, dass es sich im regulären System-RAM und nicht im teuren GPU-Speicher befindet, was laut Qwen-Team relativ geringe zusätzliche Kosten verursacht – eine architektonische Innovation, die in Qwen4 umgesetzt werden soll.

Das Modell unterstützt nativ ein Kontextfenster mit 262.144 Token und lässt sich mithilfe der YaRN-Long-Context-Erweiterung auf eine Million Token skalieren. Ein technischer Bericht wird auf GitHub veröffentlicht.

Benchmarks: Codierung und Büroarbeit

In den Benchmarks von Alibaba steht Flash-Next gegen DeepSeek-V4-Flash (284 Milliarden Parameter, 13 Milliarden aktiv) und Claude Opus 4.6 (Max) von Anthropic. Obwohl beide Konkurrenten viel größer oder teurer sind, ist Flash-Next bei den meisten getesteten Aufgaben führend, mit den größten Zuwächsen bei Codierung und Büroproduktivität.

Bei der Agentencodierung erreichte Flash-Next 58,7 auf DeepSWE 1.1 und 62,5 auf SWE-Bench Pro und schlug damit sowohl DeepSeek-V4-Flash als auch Claude Opus 4,6. Der Abstand bei Büroaufgaben ist noch größer: 73,9 bei CoWorkBench gegenüber 45,1 bei DeepSeek-V4-Flash und 55,7 bei JobBench – fast doppelt so viel wie bei Qwen3.7-Plus mit 27,6. Die wissenschaftliche Argumentation ist in allen Bereichen sehr ähnlich: Flash-Next liegt bei 91,7 bei GPQA Diamond und 91,9 bei LiveCodeBench v6. Claude Opus 4.6 hat bei Humanity's Last Exam nur mit 40,0 bis 35,9 die Nase vorn und ist ein älteres Anthropic-Modell vom Februar 2026. Wie immer können veröffentlichte Benchmark-Ergebnisse und die Leistung in der Praxis abweichen.

Preisdruck auf jeden Konkurrenten

Die Produktionsversion wird als Qwen3.8-Flash über QwenCloud ausgeliefert und kostet 0,16 US-Dollar pro Million Input-Tokens und 0,47 US-Dollar pro Million Output-Tokens. Das liegt sogar unter dem GLM-5.3-Flash von Z.ai, der am selben Tag für 0,15 bzw. 0,50 US-Dollar auf den Markt kam – praktisch Parität am unteren Ende des Marktes.

Der Abstand zum eigenen Flaggschiff von Alibaba ist groß. Qwen3.8-Max, das Anfang August eingeführt wurde, um mit Claude Opus 4.8, Gemini 3.1 Pro und GPT-5.6 Sol zu konkurrieren, kostet 2,00 US-Dollar pro Million Input-Tokens und 6,00 US-Dollar pro Million Output-Tokens. Nach Alibabas eigenen Zahlen liegt Flash-Next mit etwa einem Zwölftel des Preises sowohl bei der Ein- als auch bei der Ausgabe knapp unter dem Flaggschiff.

Der lange Kontext bietet einen praktischen Mehrwert, der über das Datenblatt hinausgeht. Bei 262.144 nativen Token kann eine einzelne Anfrage mehrere große Code-Repositories, einen vollständigen Vertragssatz oder stundenlange transkribierte Besprechungen enthalten; Mit YaRN auf eine Million Token erweitert, wird eine Analyse des gesamten Korpus ohne Abrufgerüst möglich. Für die Agenten-Codierungs-Workloads, bei denen Flash-Next seine besten Ergebnisse erzielt – das unabhängige Finden und Beheben von Fehlern in echten Softwareprojekten – bedeutet ein großes Fenster weniger Fehler bei der Kontextverwaltung während der Aufgabe. Das Qwen-Team hat den technischen Bericht auch auf GitHub veröffentlicht und lädt damit zu genau der Art unabhängiger Architekturprüfung ein, die proprietäre Labore vermeiden.

Warum diese Veröffentlichung wichtig ist

Qwen3.8-Flash-Next lässt sich am besten als öffentliche Generalprobe für Qwen4 verstehen. Die N-Gramm-Einbettungsschicht, das aggressive Verhältnis aktiver Parameter und die RAM-Auslagerung sperriger, aber selten benötigter Parameter skizzieren eine Designphilosophie: Intelligenz pro Dollar bewegen, nicht Intelligenz pro GPU. Das Trainieren eines Qwen3.7-Plus-Modells für ein Neuntel der Kosten ist genau die Fähigkeit, die schnelle Iterationszyklen erschwinglich macht – und die Iterationsgeschwindigkeit entscheidet mehr als jeder einzelne Benchmark darüber, wer in einem Jahr an der Spitze steht.

Die Ankunft zweier grenzüberschreitender Open-Weight-Modelle aus chinesischen Labors am selben Tag – Z.ais GLM-5.3-Flash und Alibabas Flash-Next – markiert ebenfalls einen Rhythmuswechsel, wie FourWeekMBA feststellte. Westliche Labore halten immer noch Benchmark-Höchstwerte, aber die offene Gewichtsklasse liefert jetzt wöchentlich nahezu grenzwertige Qualität zu Preisen, die um eine Größenordnung niedriger sind.

Für Entwickler ist die praktische Erkenntnis einfach: Die Kosten für ein leistungsfähiges, multimodales Modell mit langem Kontext sind gerade wieder gesunken, mit herunterladbaren Gewichten als Versicherung gegen jeden einzelnen Anbieter. Für die Wettbewerber ist die Botschaft weniger erfreulich: Die Effizienzgrenze verschiebt sich jetzt schneller, als die Flaggschiff-Preise realistischerweise folgen können, und Alibaba hat keine Anzeichen einer Verlangsamung gezeigt.

---

Der KI einen Schritt voraus sein

Erhalten Sie die neuesten KI-Nachrichten, Analysen und Durchbrüche – alles an einem Ort.

Weitere KI-Neuigkeiten lesen →