Ein wenig bekanntes Open-Source-Projekt namens Strata hat einen Moment Zeit. Die vom MIT lizenzierte Engine, die Alibabas Qwen3.8-Flash-Next – ein Expertenmischungsmodell mit 125 Milliarden Parametern – auf gewöhnlichen Gaming-PCs ausführt, schoss am 4. Oktober mit mehr als 640 Punkten auf die Titelseite von Hacker News, und ihr GitHub-Repository hat seit seiner Erstellung am 24. September über 11.000 Sterne gesammelt.
Der Grundgedanke ist einfach: Ein 125-Milliarden-Parameter-Modell, das normalerweise auf einem Server läuft, kann vollständig auf einer Consumer-Grafikkarte chatten, Code schreiben, Bilder lesen und Codierungsagenten steuern, ohne dass nichts die Maschine verlässt.
Was Strata tatsächlich macht
Strata ist sowohl eine Inferenz-Engine als auch ein Ein-Klick-Installationsprogramm für Windows und Linux. Laut der Dokumentation sind die Anforderungen für Grenzmodellstandards bescheiden: eine GPU mit mindestens 12 GB VRAM aus der RTX 20-, 30-, 40- oder 50-Serie von NVIDIA oder AMDs Radeon RX 6000-, 7000- oder 9000-Serie, mindestens 32 GB System-RAM und etwa 80 GB freier SSD-Speicherplatz.
Die Engine liefert quantisierte Versionen von Qwen3.8-Flash-Next mit mehreren Komprimierungsstufen, von Q2_0 bis IQ3_S, sowie eine auf Code spezialisierte Variante. Es stellt OpenAI- und Anthropic-kompatible APIs auf localhost bereit, was bedeutet, dass für ChatGPT oder Claude erstellte Tools – einschließlich Codierungsagenten wie Claude Code, Cursor und Codex – mit minimalen Änderungen auf den lokalen Server verwiesen werden können. Optionale Bildeingabe und Multi-GPU-Unterstützung sind enthalten, und das Installationsprogramm bietet sogar einen KI-gestützten Einrichtungsmodus, der es einem Codierungsassistenten ermöglicht, die Maschine anhand einer einzigen eingefügten Eingabeaufforderung zu konfigurieren.
Die Geschwindigkeitszahlen
Die veröffentlichten Benchmarks des Projekts, gemessen auf zwei Consumer-Desktops, sind der Grund für die Verbreitung der Veröffentlichung. Auf einer NVIDIA RTX 5070 mit 12 GB VRAM gepaart mit einem Ryzen 5 7600 und 64 GB RAM berichtet Strata:
- Q2_0-Quantisierung: 94 Token pro Sekunde für die Generierung und 2.650 Token pro Sekunde für die sofortige Verarbeitung eines 32-KByte-Token-Dokuments
- IQ3_S: 53 Token pro Sekunde Generation, 1.620 Token pro Sekunde Eingabeaufforderungsverarbeitung
- Coder-Variante: 55 Token pro zweite Generation
Auf der AMD-Seite schaffte eine RX 9070 XT mit 16 GB VRAM bei Q2_0 60 Token pro Sekunde. In der Dokumentation wird geschätzt, dass eine RTX 3090 mit 24 GB VRAM 100 bis 140 Token pro Sekunde erreichen sollte – schneller, als die meisten Leute lesen können.
Zum Vergleich: Vor sechs Monaten erforderte die lokale Ausführung selbst eines Modells mit einer Dichte von 70 Milliarden Parametern und brauchbarer Geschwindigkeit eine Workstation mit Hunderten von Gigabyte einheitlichem Speicher oder aggressive spekulative Decodierungstricks.
Warum ein 125B-Modell auf eine Gaming-Karte passt
Zwei Technologien machen dies möglich. Das erste ist das Modell selbst. Wie AI Buzz Wire bei seiner Veröffentlichung berichtete, handelt es sich bei Qwen3.8-Flash-Next um eine Expertenmischung mit etwa 125 Milliarden Gesamtparametern, aber nur etwa 6 Milliarden aktiven pro Token – jedes generierte Wort berührt also einen kleinen Teil des Netzwerks, was die Rechenleistung pro Token drastisch reduziert.
Die zweite ist die Quantisierung. Die schnellsten Voreinstellungen von Strata komprimieren die Gewichtungen des Modells auf zwei oder drei Bits pro Parameter und tauschen dabei etwas Genauigkeit gegen einen Platzbedarf ein, der für eine 12-GB-GPU und einen System-RAM geeignet ist. Dieser Kompromiss ist der größte Vorbehalt: Quants der Q2- und IQ2-Klasse verschlechtern messbar die Qualität bei Aufgaben, bei denen es um logisches Denken geht, und Käufer sollten die Schlagzeilen-Geschwindigkeitszahlen als Ausgangspunkt und nicht als Garantie für jede Arbeitslast betrachten. Community-Benchmark-Seiten im Repository verfolgen Qualitätsergebnisse über alle Größen hinweg.
Teil einer größeren lokalen KI-Welle
Strata kommt inmitten der zunehmenden Dynamik lokaler Schlussfolgerungen. Die Qwen-Familie von Alibaba hat sich zur am häufigsten heruntergeladenen Open-Weight-Modellreihe entwickelt, Meta und Google verfügen über eigene Open-Source-Konkurrenzmodelle und eine Welle von Tools ermöglicht es Verbrauchern nun, leistungsfähige Assistenten ohne Abonnements oder ohne Datenverlust auf ihren Geräten auszuführen.
Das Projekt spiegelt auch wider, wie sich die Definition von „Consumer-Hardware“ verändert. Eine 2026-Grafikkarte der Mittelklasse mit 12 GB VRAM, die hauptsächlich für Spiele ausgeliefert wurde, ist jetzt ein brauchbarer Inferenzbeschleuniger für ein Modell in der Größenklasse, die noch vor zwei Jahren Grenzsysteme definierte.
Strata bleibt eine frühe Software – der Issues-Tracker des Repositorys dokumentiert Ecken und Kanten bei älteren GPUs und Nicht-AVX2-Prozessoren – aber das Projekt ist MIT-lizenziert, kostenlos und wird offen entwickelt, mit experimenteller Unterstützung für Intel Arc, ältere Tesla- und Radeon-Karten und Multi-GPU-Rigs, die von Community-Mitgliedern dokumentiert wurden.
Der praktischste Vorteil für Entwickler dürfte die Localhost-API-Kompatibilität sein: Jedes Skript oder jeder Agent, der für das OpenAI- oder Anthropic-SDK geschrieben wurde, kann durch Ändern einer Basis-URL zu einer lokalen Qwen-Bereitstellung umgeleitet werden, was Strata zu einer unkomplizierten Option für datenschutzrelevantes Prototyping, Offline-Nutzung oder einfach zur Begrenzung der API-Ausgaben macht.
So probieren Sie es aus
Für den Einstieg ist keine Terminalsitzung mit Handbuch erforderlich. Das Installationsprogramm stellt Treiber, Modellgewichte und den lokalen Server in einem Durchgang bereit, und das Repository enthält eine Setup-Datei, die direkt in einen KI-Codierungsassistenten eingefügt werden kann, der die Maschine dann autonom konfiguriert. Erststarts sind langsamer, während Gewichte von der Festplatte geladen werden; Die Dokumentation empfiehlt eine SSD und warnt davor, dass lange Gespräche mehr Arbeit auf den System-RAM verlagern.
Bleiben Sie der KI immer einen Schritt vorausFolgen Sie AI Buzz Wire, um die neuesten Informationen zu Open-Source-Modellen, lokalen KI-Tools und Inferenzhardware zu erhalten.
Weitere KI-Neuigkeiten lesen →