Echipa Qwen a lui Alibaba a lansat miercuri Qwen3.8-Flash-Next, un model multimodal de amestec de experți care se dublează ca o previzualizare a arhitecturii viitorului Qwen4 – și care oferă rezultate, despre care compania spune că depășește Qwen3.7-Plus mult mai mare cu aproximativ o nouă parte din costul de instruire. Reuters, Bloomberg și The Decoder au acoperit toate lansarea, care pune greutăți deschise pe Hugging Face și ModelScope în aceeași zi în care Z.ai și-a livrat propriul model deschis adiacent frontierei. Urmăriți știrile de ultimă oră AI pe măsură ce cursa de greutate deschisă accelerează.
O nouă arhitectură în miniatură
Specificația principală este eficiența. Qwen3.8-Flash-Next are 125 de miliarde de parametri în total, dar activează doar 6 miliarde per token. Pentru comparație, Qwen3.7-Plus – modelul pe care îl depășește în benchmark-urile publicate de Alibaba – are 397 de miliarde de parametri totali, cu 17 miliarde activați per token, de aproape trei ori numărul activ al Flash-Next.
Piesa cea mai interesantă din punct de vedere tehnic este un nou strat de încorporare N-gram care poartă 51 de miliarde de parametri. Stratul stochează grupuri de cuvinte obișnuite ca intrări de sine stătătoare în ceea ce Matthias Bastian de la The Decoder a descris ca un fel de „dicționar de fraze”, introducând informații la nivel de frază la începutul rețelei. În mod esențial, se află în memoria RAM obișnuită a sistemului, mai degrabă decât în memoria GPU scumpă, la ceea ce echipa Qwen numește cost suplimentar relativ scăzut - o inovație arhitecturală care urmează să fie adusă în Qwen4.
Modelul acceptă nativ o fereastră de context de 262.144 de jetoane și se scalează la un milion de jetoane folosind extensia YaRN de context lung. Un raport tehnic este publicat pe GitHub.
Benchmark-uri: codare și muncă de birou
Valorile de referință ale Alibaba opun Flash-Next cu DeepSeek-V4-Flash (284 de miliarde de parametri, 13 miliarde activi) și Claude Opus 4.6 (Max) de la Anthropic. În ciuda faptului că ambii rivali sunt mult mai mari sau mai scumpi, Flash-Next conduce în majoritatea sarcinilor testate, cu cele mai mari câștiguri în codificare și productivitate de birou.
La codificarea agentică, Flash-Next a obținut 58,7 pe DeepSWE 1.1 și 62,5 pe SWE-bench Pro, învingând atât DeepSeek-V4-Flash, cât și Claude Opus 4.6. Diferența dintre sarcinile de birou este și mai mare: 73,9 pe CoWorkBench față de 45,1 pentru DeepSeek-V4-Flash și 55,7 pe JobBench - aproape dublu față de 27,6 pentru Qwen3.7-Plus. Raționamentul științific este strâns comparat în domeniu, cu Flash-Next la 91,7 pe GPQA Diamond și 91,9 pe LiveCodeBench v6. Claude Opus 4.6 iese înainte doar la Humanity's Last Exam, de la 40.0 la 35.9, și este un model antropic mai vechi din februarie 2026. Ca întotdeauna, scorurile de referință publicate și performanța în lumea reală pot diferi.
Presiunea prețurilor asupra fiecărui rival
Versiunea de producție se livrează ca Qwen3.8-Flash prin QwenCloud, la un preț de 0,16 USD per milion de jetoane de intrare și 0,47 USD per milion de jetoane de ieșire. Acest lucru subcutează chiar și GLM-5.3-Flash de la Z.ai, lansat în aceeași zi la 0,15 USD și, respectiv, 0,50 USD - efectiv paritate în partea de jos a pieței.
Diferența față de propriul flagship al Alibaba este mare. Qwen3.8-Max, introdus la începutul lunii august pentru a concura cu Claude Opus 4.8, Gemini 3.1 Pro și GPT-5.6 Sol, costă 2,00 USD per milion de jetoane de intrare și 6,00 USD per milion de jetoane de ieșire. Flash-Next funcționează chiar sub nava emblematică, conform propriilor numere ale Alibaba, la aproximativ o doisprezece parte din prețul atât la intrare, cât și la ieșire.
Contextul lung adaugă valoare practică dincolo de fișa de specificații. La 262.144 de jetoane native, o singură solicitare poate conține mai multe depozite mari de coduri, un set complet de contracte sau ore de întâlniri transcrise; extinsă la un milion de jetoane cu YaRN, analiza întregului corpus devine fezabilă fără schele de recuperare. Pentru sarcinile de lucru de codare agentică în care Flash-Next își postează cele mai bune scoruri - găsirea și remedierea independentă a erorilor în proiecte software reale - o fereastră mare înseamnă mai puține eșecuri de gestionare a contextului la mijlocul sarcinii. Echipa Qwen a publicat, de asemenea, raportul tehnic pe GitHub, invitând exact genul de analiză independentă a arhitecturii pe care laboratoarele proprietare îl evită.
De ce contează această versiune
Qwen3.8-Flash-Next este cel mai bine înțeles ca o repetiție generală publică pentru Qwen4. Stratul de încorporare N-gram, raportul agresiv al parametrilor activi și descărcarea RAM a parametrilor voluminosi, dar rareori necesari schițează o filozofie de design: mută inteligența pe dolar, nu inteligența pe GPU. Antrenarea unui model Qwen3.7-Plus pentru o nouă parte din cost este tocmai capacitatea care face ca ciclurile de iterație rapide să fie accesibile - iar viteza de iterare, mai mult decât orice punct de referință, este cea care decide cine se află la frontieră peste un an.
Sosirea în aceeași zi a două modele deschise adiacente frontierei din laboratoarele chinezești – GLM-5.3-Flash de la Z.ai și Flash-Next de la Alibaba – marchează, de asemenea, o schimbare de cadență, după cum a observat FourWeekMBA. Laboratoarele occidentale dețin în continuare vârfuri de referință, dar nivelul deschis este acum livrat săptămânal de calitate aproape de frontieră, la prețuri cu un ordin de mărime mai mici.
Pentru dezvoltatori, concluzia practică este simplă: costul unui model multimodal capabil, cu context lung, tocmai a scăzut din nou, cu greutăți descărcabile ca asigurare împotriva oricărui furnizor. Pentru concurenți, mesajul este mai puțin confortabil – frontiera eficienței se mișcă acum mai repede decât poate urma în mod realist prețurile emblematice, iar Alibaba nu a dat semne de încetinire.
---
Rămâneți înaintea AIObțineți cele mai recente știri, analize și descoperiri despre AI - toate într-un singur loc.
Citește mai multe știri AI →