Alibabas Qwen-team släppte Qwen3.8-Flash-Next på onsdagen, en multimodal blandning-av-expert-modell som fungerar som en arkitekturförhandsvisning av den kommande Qwen4 – och som ger resultat som företaget säger slog sin mycket större Qwen3.7-Plus till ungefär en niondel av utbildningskostnaden. Reuters, Bloomberg och The Decoder täckte alla lanseringen, som sätter öppna vikter på Hugging Face och ModelScope samma dag som Z.ai skickade sin egen gränsöverskridande öppna modell. Följ de brytande AI-nyheterna när loppet med öppen vikt accelererar.

En ny arkitektur i miniatyr

Rubrikspecifikationen är effektivitet. Qwen3.8-Flash-Next har totalt 125 miljarder parametrar men aktiverar bara 6 miljarder per token. Som jämförelse har Qwen3.7-Plus – modellen den överträffar i Alibabas publicerade riktmärken – totalt 397 miljarder parametrar med 17 miljarder aktiverade per token, nästan tre gånger Flash-Nexts aktiva antal.

Det mest tekniskt intressanta stycket är ett nytt N-gram inbäddningslager som bär 51 miljarder parametrar. Lagret lagrar vanliga ordgrupper som fristående poster i vad The Decoders Matthias Bastian beskrev som en slags "frasordbok", som matar information på frasnivå till starten av nätverket. Avgörande är att det sitter i vanligt system-RAM snarare än i dyrt GPU-minne, till vad Qwen-teamet kallar relativt låga extrakostnader - en arkitektonisk innovation som är tänkt att bära in i Qwen4.

Modellen stöder inbyggt ett 262 144-tokens kontextfönster och skalas till en miljon tokens med YaRN-långkontextförlängning. En teknisk rapport publiceras på GitHub.

Benchmarks: kodning och kontorsarbete

Alibabas riktmärken ställer Flash-Next mot DeepSeek-V4-Flash (284 miljarder parametrar, 13 miljarder aktiva) och Anthropics Claude Opus 4.6 (Max). Trots att båda konkurrenterna är mycket större eller dyrare, leder Flash-Next i de flesta testade uppgifterna, med de största vinsterna i kodning och kontorsproduktivitet.

På agentkodning fick Flash-Next 58,7 på DeepSWE 1.1 och 62.5 på SWE-bench Pro, och slog både DeepSeek-V4-Flash och Claude Opus 4.6. Klyftan för kontorsuppgifter är ännu större: 73,9 på CoWorkBench mot 45,1 för DeepSeek-V4-Flash och 55,7 på JobBench - nästan dubbelt så mycket som Qwen3.7-Plus 27,6. Vetenskapliga resonemang är nära matchade över hela fältet, med Flash-Next på 91,7 på GPQA Diamond och 91,9 på LiveCodeBench v6. Claude Opus 4.6 kommer först ut på Humanity's Last Exam, 40,0 till 35,9, och det är en äldre antropisk modell från februari 2026. Som alltid kan publicerade benchmarkpoäng och verkliga prestanda skilja sig åt.

Prispress på varje rival

Produktionsversionen levereras som Qwen3.8-Flash genom QwenCloud, prissatt till $0,16 per miljon inmatade tokens och $0,47 per miljon output-tokens. Det underskrider till och med Z.ai:s GLM-5.3-Flash, som släpptes samma dag till $0,15 respektive $0,50 - i praktiken paritet i botten av marknaden.

Gapet till Alibabas eget flaggskepp är stort. Qwen3.8-Max, som introducerades i början av augusti för att konkurrera med Claude Opus 4.8, Gemini 3.1 Pro och GPT-5.6 Sol, kostar $2,00 per miljon inmatade tokens och $6,00 per miljon output-tokens. Flash-Next presterar precis under flaggskeppet, enligt Alibabas egna siffror, till ungefär en tolftedel av priset på både input och output.

Det långa sammanhanget tillför praktiskt värde bortom specifikationsbladet. Vid 262 144 inbyggda tokens kan en enda begäran innehålla flera stora kodlager, en fullständig kontraktsuppsättning eller timmar av transkriberade möten; utökas till en miljon tokens med YaRN, blir helkorpusanalys genomförbar utan hämtningsställningar. För de agentiska kodningsarbetsbelastningarna där Flash-Next publicerar sina starkaste poäng – att självständigt hitta och fixa buggar i riktiga programvaruprojekt – innebär ett stort fönster färre fel i kontexthantering mitt i arbetet. Qwen-teamet har också publicerat den tekniska rapporten på GitHub, och bjuder in exakt den typ av oberoende arkitekturgranskning som proprietära labb undviker.

Varför den här utgåvan är viktig

Qwen3.8-Flash-Next förstås bäst som en offentlig generalrepetition för Qwen4. N-gram inbäddningsskiktet, det aggressiva förhållandet mellan aktiva parametrar och RAM-avlastning av skrymmande men sällan nödvändiga parametrar skisserar en designfilosofi: flytta intelligens per dollar, inte intelligens per GPU. Att träna en Qwen3.7-Plus-beating-modell för en niondedel av kostnaden är just den förmågan som gör snabba iterationscykler överkomliga – och iterationshastigheten, mer än något enskilt riktmärke, är det som avgör vem som står vid gränsen om ett år.

Samma dag ankomsten av två intilliggande gränsmodeller med öppen vikt från kinesiska laboratorier - Z.ai:s GLM-5.3-Flash och Alibabas Flash-Next - markerar också ett kadensskifte, som FourWeekMBA observerade. Västerländska laboratorier håller fortfarande benchmark-toppar, men den öppna viktnivån levererar nu kvalitet nära gränsen varje vecka, till priser som är en storleksordning lägre.

För utvecklare är den praktiska takeawayen enkel: kostnaden för en kapabel multimodal modell med långa kontexter sjönk precis igen, med nedladdningsbara vikter som försäkring mot en enskild leverantör. För konkurrenter är budskapet mindre bekvämt – effektivitetsgränsen rör sig nu snabbare än flaggskeppspriserna realistiskt kan följa, och Alibaba har inte visat några tecken på att sakta ner.

---

Stay ahead of AI

Få de senaste AI-nyheterna, analyserna och genombrotten – allt på ett ställe.

Läs mer AI-nyheter →