Een weinig bekend open-sourceproject genaamd Strata heeft een momentje. De door MIT gelicentieerde engine, die Alibaba's Qwen3.8-Flash-Next draait – een mix van experts-model met 125 miljard parameters – op gewone gaming-pc’s, werd op 4 oktober op de voorpagina van Hacker News geplaatst met meer dan 640 punten, en de GitHub-repository heeft sinds de oprichting op 24 september meer dan 11.000 sterren verzameld.

De pitch is simpel: een model met 125 miljard parameters dat normaal gesproken op een server staat, kan chatten, code schrijven, afbeeldingen lezen en codeeragenten aansturen, volledig op een grafische consumentenkaart, zonder dat er iets de machine verlaat.

Wat Strata eigenlijk doet

Strata is zowel een gevolgtrekkingsengine als een installatieprogramma met één klik voor Windows en Linux. Volgens de documentatie zijn de vereisten bescheiden volgens de normen van grensmodellen: een GPU met minimaal 12 GB VRAM uit NVIDIA's RTX 20, 30, 40 of 50-serie of AMD's Radeon RX 6000, 7000 of 9000-serie, minimaal 32 GB systeem-RAM en ongeveer 80 GB vrije SSD-ruimte.

De engine levert gekwantiseerde versies van Qwen3.8-Flash-Next op verschillende compressieniveaus, van Q2_0 tot IQ3_S, plus een code-gespecialiseerde variant. Het stelt OpenAI en Anthropic-compatibele API's bloot op localhost, wat betekent dat tools die zijn gebouwd voor ChatGPT of Claude (inclusief codeeragenten zoals Claude Code, Cursor en Codex) met minimale wijzigingen naar de lokale server kunnen worden verwezen. Optionele beeldinvoer en ondersteuning voor meerdere GPU's zijn inbegrepen, en het installatieprogramma biedt zelfs een AI-ondersteunde installatiemodus waarmee een codeerassistent de machine kan configureren vanaf een enkele geplakte prompt.

De snelheidsnummers

De gepubliceerde benchmarks van het project, gemeten op twee consumentendesktops, zijn de reden dat de release zich verspreidde. Op een NVIDIA RTX 5070 met 12 GB VRAM gecombineerd met een Ryzen 5 7600 en 64 GB RAM rapporteert Strata:

  • Q2_0 kwantisering: 94 tokens per seconde voor generatie en 2.650 tokens per seconde voor snelle verwerking op een document met 32K token
  • IQ3_S: 53 tokens per tweede generatie, 1.620 tokens per seconde promptverwerking
  • Codervariant: 55 tokens per tweede generatie

Aan de AMD-kant beheerde een RX 9070 XT met 16 GB VRAM 60 tokens per seconde in Q2_0. De documentatie schat dat een RTX 3090 met 24 GB VRAM 100 tot 140 tokens per seconde zou moeten halen – sneller dan de meeste mensen kunnen lezen.

Ter vergelijking: zes maanden geleden vereiste het lokaal draaien van zelfs een model met een dichtheid van 70 miljard parameters op bruikbare snelheden een werkstation met honderden gigabytes aan verenigd geheugen of agressieve speculatieve decoderingstrucs.

Waarom een 125B-model op een gamingkaart past

Twee stukjes technologie maken dit mogelijk. De eerste is het model zelf. Zoals AI Buzz Wire bij de release aangaf, is Qwen3.8-Flash-Next een mix van experts-architectuur met grofweg 125 miljard totale parameters, maar slechts ongeveer 6 miljard actief per token. Elk gegenereerd woord raakt dus een klein deel van het netwerk, waardoor de rekenkracht per token dramatisch wordt verminderd.

De tweede is kwantisering. De snelste presets van Strata comprimeren de gewichten van het model tot twee of drie bits per parameter, waarbij enige nauwkeurigheid wordt ingeruild voor een footprint die past over een GPU en systeem-RAM van 12 GB. Die afweging is het belangrijkste voorbehoud: Q2-klasse en IQ2-klasse quants verminderen meetbaar de kwaliteit bij taken die zwaar redeneren, en kopers moeten de snelheidscijfers als uitgangspunt beschouwen in plaats van als garantie voor elke werklast. Community-benchmarkpagina's in de repository houden de kwaliteitsresultaten bij voor alle formaten.

Onderdeel van een grotere lokale AI-golf

Strata arriveert te midden van een steeds sneller momentum voor lokale gevolgtrekkingen. Alibaba's Qwen-familie is de meest gedownloade open-weight-modellijn geworden, Meta en Google hebben hun eigen open-source competitieve modellen, en een golf aan tools laat consumenten nu over capabele assistenten beschikken zonder dat abonnementen of gegevens hun apparaten verlaten.

Het project weerspiegelt ook hoe de definitie van "consumentenhardware" aan het verschuiven is. Een grafische kaart uit het middensegment uit 2026 met 12 GB VRAM, die voornamelijk voor gaming werd geleverd, is nu een haalbare inferentieversneller voor een model in de grootteklasse die nog maar twee jaar geleden grenssystemen definieerde.

Strata blijft vroege software – de issues tracker van de repository documenteert de ruwe kantjes van oudere GPU’s en niet-AVX2-processors – maar het project is MIT-gelicentieerd, gratis en in de open lucht ontwikkeld, met experimentele ondersteuning voor Intel Arc, oudere Tesla- en Radeon-kaarten, en multi-GPU-installaties gedocumenteerd door leden van de gemeenschap.

Voor ontwikkelaars is de compatibiliteit met de localhost API misschien wel de meest praktische oplossing: elk script of elke agent die tegen de OpenAI of Anthropic SDK is geschreven, kan worden omgeleid naar een lokale Qwen-implementatie door een basis-URL te wijzigen, waardoor Strata een optie met weinig wrijving wordt voor privacygevoelige prototyping, offline gebruik of simpelweg het beperken van API-uitgaven.

Hoe je het kunt proberen

Om aan de slag te gaan, is geen terminalsessie met een handleiding vereist. Het installatieprogramma voorziet stuurprogramma's, modelgewichten en de lokale server in één keer, en de repository bevat een installatiebestand dat is ontworpen om rechtstreeks in een AI-coderingsassistent te worden geplakt, die vervolgens de machine autonoom configureert. De eerste lanceringen zijn langzamer terwijl de gewichten vanaf de schijf worden geladen; de documentatie beveelt een SSD aan en waarschuwt dat lange gesprekken meer werk naar het systeem-RAM verleggen.

Blijf AI een stap voor

Volg AI Buzz Wire voor het laatste nieuws over open-sourcemodellen, lokale AI-tools en inferentiehardware.

Lees meer AI-nieuws →