Tým Qwen společnosti Alibaba ve středu vydal Qwen3.8-Flash-Next, multimodální model směsi odborníků, který slouží jako náhled architektury nadcházejícího Qwen4 – a přináší výsledky, o kterých společnost tvrdí, že porazily svůj mnohem větší Qwen3.7-Plus za zhruba jednu devítinu nákladů na školení. Agentury Reuters, Bloomberg a The Decoder pokryly uvedení na trh, které klade otevřené váhy na Hugging Face a ModelScope ve stejný den, kdy Z.ai dodal svůj vlastní otevřený model sousedící s hranicí. Sledujte nejnovější zprávy o AI, jak se závod s otevřenou váhou zrychluje.
Nová architektura v miniatuře
Hlavní specifikací je účinnost. Qwen3.8-Flash-Next má celkem 125 miliard parametrů, ale aktivuje pouze 6 miliard na token. Pro srovnání, Qwen3.7-Plus – model, který překonává v publikovaných benchmarkech Alibaba – má 397 miliard celkových parametrů se 17 miliardami aktivovaných na token, což je téměř trojnásobek aktivního počtu Flash-Next.
Technicky nejzajímavějším kouskem je nová N-gramová vkládací vrstva nesoucí 51 miliard parametrů. Vrstva ukládá běžné skupiny slov jako samostatné položky v tom, co Matthias Bastian z The Decoder popsal jako jakýsi „slovník frází“, který dodává informace na úrovni frází do začátku sítě. Rozhodující je, že je umístěn v běžné systémové paměti RAM spíše než v drahé paměti GPU, za to, co tým Qwen nazývá relativně nízkými dodatečnými náklady – architektonickou inovaci, která má být přenesena do Qwen4.
Model nativně podporuje kontextové okno s 262 144 tokeny a lze jej škálovat na jeden milion tokenů pomocí rozšíření YaRN s dlouhým kontextem. Technická zpráva je zveřejněna na GitHubu.
Benchmarky: kódování a kancelářská práce
Benchmarky Alibaby staví Flash-Next proti DeepSeek-V4-Flash (284 miliard parametrů, 13 miliard aktivních) a Anthropic's Claude Opus 4.6 (Max). Navzdory tomu, že oba soupeři jsou mnohem větší nebo dražší, Flash-Next vede ve většině testovaných úloh s největšími zisky v kódování a kancelářské produktivitě.
Pokud jde o agentní kódování, Flash-Next dosáhl skóre 58,7 na DeepSWE 1.1 a 62,5 na SWE-bench Pro, čímž porazil DeepSeek-V4-Flash i Claude Opus 4.6. Rozdíl v kancelářských úlohách je ještě větší: 73,9 na CoWorkBench oproti 45,1 pro DeepSeek-V4-Flash a 55,7 na JobBench — téměř dvojnásobek Qwen3.7-Plus 27,6. Vědecké uvažování je v celé oblasti velmi podobné, s Flash-Next na 91,7 na GPQA Diamond a 91,9 na LiveCodeBench v6. Claude Opus 4.6 vychází pouze na Humanity's Last Exam, 40.0 až 35.9, a je to starší model Anthropic z února 2026. Jako vždy se mohou publikované výsledky benchmarků a výkon v reálném světě lišit.
Cenový tlak na každého soupeře
Produkční verze je dodávána jako Qwen3.8-Flash prostřednictvím QwenCloud za cenu 0,16 USD za milion vstupních tokenů a 0,47 USD za milion výstupních tokenů. To podkopává dokonce i Z.ai's GLM-5.3-Flash, vydaný ve stejný den za 0,15 dolaru a 0,50 dolaru – v podstatě parita na dně trhu.
Rozdíl k vlastní vlajkové lodi Alibaba je výrazný. Qwen3.8-Max, představený na začátku srpna, aby konkuroval Claude Opus 4.8, Gemini 3.1 Pro a GPT-5.6 Sol, stojí 2,00 $ za milion vstupních tokenů a 6,00 $ za milion výstupních tokenů. Flash-Next funguje těsně pod vlajkovou lodí, podle vlastních čísel Alibaby, za zhruba jednu dvanáctinu ceny na vstupu i výstupu.
Dlouhý kontext přidává praktickou hodnotu nad rámec specifikace. Při 262 144 nativních tokenech může jeden požadavek obsahovat několik velkých úložišť kódu, úplnou sadu smluv nebo hodiny přepsaných schůzek; rozšířena na jeden milion tokenů pomocí YaRN, je celokorpusová analýza proveditelná bez lešení pro vyhledávání. Pro zátěže agentního kódování, kde Flash-Next zveřejňuje svá nejsilnější skóre – nezávislé vyhledávání a opravování chyb ve skutečných softwarových projektech – znamená velké okno méně selhání správy kontextu uprostřed úlohy. Tým Qwen také zveřejnil technickou zprávu na GitHubu, která vyzývá přesně k tomu druhu nezávislé kontroly architektury, kterému se proprietární laboratoře vyhýbají.
Proč na tomto vydání záleží
Qwen3.8-Flash-Next se nejlépe chápe jako veřejná zkouška šatů pro Qwen4. N-gramová vkládací vrstva, agresivní poměr aktivních parametrů a odlehčení RAM objemných, ale vzácně potřebných parametrů načrtávají filozofii designu: přesun inteligence za dolar, nikoli inteligence na GPU. Trénink modelu Qwen3.7-Plus za jednu devítinu nákladů je přesně ta schopnost, díky které jsou rychlé iterační cykly dostupné – a rychlost iterace, více než jakýkoli jednotlivý benchmark, rozhoduje o tom, kdo bude za rok stát na hranici.
Příchod dvou hraničně sousedících modelů s otevřenou váhou z čínských laboratoří ve stejný den – GLM-5.3-Flash od Z.ai a Flash-Next od Alibaby – také znamená posun kadence, jak poznamenal FourWeekMBA. Západní laboratoře si stále drží vrcholy srovnávacích testů, ale úroveň s otevřenou váhou nyní dodává kvalitu blízkou hranici týdně za ceny o řád nižší.
Pro vývojáře je praktický závěr jednoduchý: náklady na schopný multimodální model s dlouhým kontextem opět klesly, s váhami ke stažení jako pojistkou proti jakémukoli jednotlivému poskytovateli. Pro konkurenty je zpráva méně pohodlná – hranice efektivity se nyní posouvá rychleji, než mohou ceny vlajkových lodí reálně následovat, a Alibaba nevykázala žádné známky zpomalení.
---
Stay Ahead of AIZískejte nejnovější zprávy, analýzy a průlomové informace o umělé inteligenci – vše na jednom místě.
Přečtěte si další zprávy o AI →