Ett föga känt projekt med öppen källkod som heter Strata har ett ögonblick. Den MIT-licensierade motorn, som kör Alibabas Qwen3.8-Flash-Next – en blandning av experter med 125 miljarder parametrar-modell – på vanliga speldatorer, sköts till förstasidan av Hacker News den 4 oktober med mer än 640 poäng, och dess GitHub-repository sedan det har skapats på 2000 stjärnor i september sedan det har samlats in över 2000 stjärnor.
Planen är enkel: en modell med 125 miljarder parametrar som normalt lever på en server kan chatta, skriva kod, läsa bilder och köra kodningsagenter helt och hållet på ett konsumentgrafikkort, utan att något lämnar maskinen.
Vad Strata faktiskt gör
Strata är både en inferensmotor och ett installationsprogram med ett klick för Windows och Linux. Enligt dess dokumentation är kraven blygsamma med gränsmodellstandarder: en GPU med minst 12 GB VRAM från NVIDIAs RTX 20, 30, 40 eller 50-serier eller AMD:s Radeon RX 6000, 7000 eller 9000-serier, minst 32 GB ledigt system-RAM-minne, minst 80 GB utrymme, och.
Motorn levererar kvantiserade versioner av Qwen3.8-Flash-Next på flera kompressionsnivåer, från Q2_0 upp till IQ3_S, plus en kodspecialiserad variant. Det exponerar OpenAI och Anthropic-kompatibla API:er på localhost, vilket innebär att verktyg byggda för ChatGPT eller Claude – inklusive kodningsagenter som Claude Code, Cursor och Codex – kan pekas mot den lokala servern med minimala ändringar. Valfri bildingång och stöd för multi-GPU ingår, och installationsprogrammet erbjuder till och med ett AI-assisterat inställningsläge som låter en kodningsassistent konfigurera maskinen från en enda inklistrad prompt.
Hastighetsnumren
Projektets publicerade riktmärken, mätt på två konsumentdatorer, är anledningen till att releasen spred sig. På en NVIDIA RTX 5070 med 12 GB VRAM parat med en Ryzen 5 7600 och 64 GB RAM, rapporterar Strata:
- Q2_0 kvantisering: 94 tokens per sekund för generering och 2 650 tokens per sekund för snabb bearbetning på ett 32K-token dokument
- IQ3_S: 53 tokens per andra generation, 1 620 tokens per sekund snabb bearbetning
- Kodarvariant: 55 tokens per andra generation
På AMD-sidan klarade en RX 9070 XT med 16 GB VRAM 60 tokens per sekund vid Q2_0. Dokumentationen uppskattar att en RTX 3090 med 24 GB VRAM bör nå 100 till 140 tokens per sekund — snabbare än de flesta människor kan läsa.
Som jämförelse, för sex månader sedan, att köra till och med en 70 miljarder parametrar tät modell lokalt med användbara hastigheter krävde en arbetsstation med hundratals gigabyte enhetligt minne eller aggressiva spekulativa avkodningstrick.
Varför en 125B-modell passar på ett spelkort
Två tekniker gör detta möjligt. Den första är själva modellen. Som AI Buzz Wire tog upp vid lanseringen är Qwen3.8-Flash-Next en blandning av expertarkitektur med cirka 125 miljarder totala parametrar men bara cirka 6 miljarder aktiva per token – så varje genererat ord berör en liten del av nätverket, vilket dramatiskt minskar beräkningen per token.
Det andra är kvantisering. Stratas snabbaste förinställningar komprimerar modellens vikter till två eller tre bitar per parameter, vilket byter ut viss noggrannhet mot ett fotavtryck som passar över en 12 GB GPU och system-RAM. Den avvägningen är huvudförbehållet: Kvant i Q2-klass och IQ2-klass försämrar mätbart kvaliteten på resonemangstunga uppgifter, och köpare bör behandla rubrikhastighetssiffrorna som en utgångspunkt snarare än en garanti för varje arbetsbelastning. Gemenskapens benchmarksidor i förvaret spårar kvalitetsresultat i olika storlekar.
Del av en större lokal-AI-våg
Strata anländer mitt i accelererande momentum för lokal slutledning. Alibabas Qwen-familj har blivit den mest nedladdade modellen med öppen vikt, Meta och Google har egna konkurrenskraftiga modeller med öppen källkod, och en våg av verktyg låter nu konsumenter köra kompetenta assistenter utan att prenumerationer eller data lämnar sina enheter.
Projektet speglar också hur definitionen av "konsumenthårdvara" förändras. Ett mellanklass 2026-grafikkort med 12 GB VRAM, som levereras främst för spel, är nu en gångbar slutledningsaccelerator för en modell i den storleksklass som definierade frontier-system för bara två år sedan.
Strata förblir tidig mjukvara – arkivets problemspårare dokumenterar grova kanter på äldre GPU:er och icke-AVX2-processorer – men projektet är MIT-licensierat, gratis och utvecklat i det fria, med experimentellt stöd för Intel Arc, äldre Tesla- och Radeon-kort och multi-GPU-riggar dokumenterade av communitymedlemmar.
För utvecklare kan det mest praktiska alternativet vara localhost API-kompatibilitet: alla skript eller agenter som skrivits mot OpenAI eller Anthropic SDK kan omdirigeras till en lokal Qwen-distribution genom att ändra en bas-URL, vilket gör Strata till ett lågfriktionsalternativ för integritetskänslig prototyp, offlineanvändning eller helt enkelt ett tak för API-utgifter.
Hur man provar det
Att komma igång kräver ingen terminalsession med en manual. Installationsprogrammet tillhandahåller drivrutiner, modellvikter och den lokala servern i ett enda steg, och förvaret innehåller en installationsfil som är utformad för att klistras in direkt i en AI-kodningsassistent, som sedan konfigurerar maskinen autonomt. Första lanseringar är långsammare medan vikter laddas från disken; dokumentationen rekommenderar en SSD och varnar för att långa samtal lägger mer arbete på system-RAM.
Lägg dig före AIFölj AI Buzz Wire för det senaste om modeller med öppen källkod, lokala AI-verktyg och inferenshårdvara.
Läs mer AI-nyheter →