Alibaba's Qwen-team heeft woensdag Qwen3.8-Flash-Next uitgebracht, een multimodaal mix-van-experts-model dat ook dienst doet als architectuurvoorproefje van de komende Qwen4 - en dat resultaten oplevert die volgens het bedrijf zijn veel grotere Qwen3.7-Plus verslaan met ongeveer een negende van de trainingskosten. Reuters, Bloomberg en The Decoder hebben allemaal verslag gedaan van de lancering, die de nadruk legt op Hugging Face en ModelScope op dezelfde dag dat Z.ai zijn eigen, aan de grens grenzende, open model verscheepte. Volg het breaking AI news terwijl de race met open gewicht versnelt.
Een nieuwe architectuur in miniatuur
De belangrijkste specificatie is efficiëntie. Qwen3.8-Flash-Next heeft in totaal 125 miljard parameters, maar activeert slechts 6 miljard per token. Ter vergelijking: Qwen3.7-Plus – het model dat het beter presteert in de gepubliceerde benchmarks van Alibaba – heeft in totaal 397 miljard parameters met 17 miljard geactiveerd per token, bijna drie keer het actieve aantal van Flash-Next.
Het technisch meest interessante stuk is een nieuwe N-gram-inbeddingslaag met 51 miljard parameters. De laag slaat gemeenschappelijke woordgroepen op als op zichzelf staande vermeldingen in wat Matthias Bastian van The Decoder omschreef als een soort 'zinnenwoordenboek', dat informatie op zinsniveau aan het begin van het netwerk toevoegt. Cruciaal is dat het in het reguliere systeem-RAM zit in plaats van in duur GPU-geheugen, tegen wat het Qwen-team relatief lage extra kosten noemt – een architectonische innovatie die naar Qwen4 zal worden doorgevoerd.
Het model ondersteunt standaard een contextvenster van 262.144 tokens en kan worden geschaald naar één miljoen tokens met behulp van de YaRN-extensie met lange context. Een technisch rapport wordt gepubliceerd op GitHub.
Benchmarks: coderen en kantoorwerk
Alibaba's benchmarks vergelijken Flash-Next met DeepSeek-V4-Flash (284 miljard parameters, 13 miljard actief) en Claude Opus 4.6 (Max) van Anthropic. Ondanks dat beide rivalen veel groter of duurder zijn, loopt Flash-Next voorop bij de meeste geteste taken, met de grootste winst op het gebied van coderen en kantoorproductiviteit.
Op het gebied van agentische codering scoorde Flash-Next 58,7 op DeepSWE 1.1 en 62,5 op SWE-bench Pro, waarmee het zowel DeepSeek-V4-Flash als Claude Opus 4.6 versloeg. De kloof bij kantoortaken is nog groter: 73,9 op CoWorkBench tegen 45,1 voor DeepSeek-V4-Flash en 55,7 op JobBench – bijna het dubbele van Qwen3.7-Plus's 27,6. De wetenschappelijke redenering komt over het hele veld nauw overeen, met Flash-Next op 91,7 op GPQA Diamond en 91,9 op LiveCodeBench v6. Claude Opus 4.6 komt pas als eerste uit op Humanity's Last Exam, 40.0 tot 35.9, en het is een ouder antropisch model uit februari 2026. Zoals altijd kunnen gepubliceerde benchmarkscores en prestaties in de echte wereld verschillen.
Prijsdruk op elke rivaal
De productieversie wordt geleverd als Qwen3.8-Flash via QwenCloud en kost $0,16 per miljoen inputtokens en $0,47 per miljoen outputtokens. Dat ondermijnt zelfs Z.ai's GLM-5.3-Flash, die dezelfde dag werd uitgebracht voor respectievelijk $0,15 en $0,50 – feitelijk pariteit aan de onderkant van de markt.
Het gat met Alibaba's eigen vlaggenschip is groot. Qwen3.8-Max, begin augustus geïntroduceerd om te concurreren met Claude Opus 4.8, Gemini 3.1 Pro en GPT-5.6 Sol, kost $2,00 per miljoen inputtokens en $6,00 per miljoen outputtokens. Flash-Next presteert net onder het vlaggenschip, volgens Alibaba's eigen cijfers, tegen ongeveer een twaalfde van de prijs op zowel input als output.
De lange context voegt praktische waarde toe buiten het specificatieblad. Met 262.144 native tokens kan één verzoek meerdere grote codeopslagplaatsen, een volledige contractset of uren aan getranscribeerde vergaderingen bevatten; uitgebreid tot één miljoen tokens met YaRN, wordt analyse van het hele corpus mogelijk zonder ophaalsteigers. Voor de agentische coderingswerklasten waarbij Flash-Next de sterkste scores boekt (het onafhankelijk vinden en repareren van bugs in echte softwareprojecten) betekent een groot venster minder fouten in het contextbeheer halverwege de taak. Het Qwen-team heeft ook het technische rapport op GitHub gepubliceerd, waarin precies het soort onafhankelijk architectuuronderzoek wordt uitgenodigd dat propriëtaire laboratoria vermijden.
Waarom deze release ertoe doet
Qwen3.8-Flash-Next kan het best worden begrepen als een openbare generale repetitie voor Qwen4. De N-gram-inbeddingslaag, de agressieve actieve-parameterverhouding en het RAM-offloaden van omvangrijke maar zelden benodigde parameters schetsen een ontwerpfilosofie: verplaats intelligentie per dollar, niet intelligentie per GPU. Het trainen van een Qwen3.7-Plus-kloppend model voor een negende van de kosten is precies de mogelijkheid die snelle iteratiecycli betaalbaar maakt – en iteratiesnelheid is, meer dan welke benchmark dan ook, wat bepaalt wie over een jaar aan de grens staat.
De aankomst op dezelfde dag van twee aan de grens grenzende open-weight-modellen van Chinese laboratoria – Z.ai's GLM-5.3-Flash en Alibaba's Flash-Next – markeert ook een cadansverschuiving, zoals FourWeekMBA opmerkte. Westerse laboratoria hebben nog steeds benchmarkpieken, maar het open-gewichtsegment verzendt nu wekelijks bijna grensverleggende kwaliteit, tegen prijzen die een orde van grootte lager zijn.
Voor ontwikkelaars is de praktische conclusie eenvoudig: de kosten van een capabel, multimodaal model met lange context zijn zojuist weer gedaald, met downloadbare gewichten als verzekering tegen één enkele aanbieder. Voor concurrenten is de boodschap minder comfortabel: de efficiëntiegrens beweegt zich nu sneller dan de vlaggenschipprijzen realistisch gezien kunnen volgen, en Alibaba heeft geen tekenen van vertraging laten zien.
---
Blijf AI een stap voorOntvang het laatste AI-nieuws, analyses en doorbraken – allemaal op één plek.
Lees meer AI-nieuws →