Zespół Alibaba Qwen wypuścił w środę Qwen3.8-Flash-Next, multimodalny model będący mieszanką ekspertów, który może również służyć jako podgląd architektury nadchodzącego Qwen4 – i który zapewnia wyniki, które według firmy przewyższają znacznie większy Qwen3.7-Plus przy mniej więcej jednej dziewiątej kosztu szkolenia. Reuters, Bloomberg i The Decoder relacjonowały premierę, co wyłożyło otwarte wagi dla Hugging Face i ModelScope tego samego dnia, w którym Z.ai wysłał swój własny otwarty model przylegający do granicy. Śledź najświeższe wiadomości o sztucznej inteligencji, gdy wyścig w wadze otwartej nabiera tempa.

Nowa architektura w miniaturze

Główną specyfikacją jest wydajność. Qwen3.8-Flash-Next ma łącznie 125 miliardów parametrów, ale aktywuje tylko 6 miliardów na token. Dla porównania, Qwen3.7-Plus — model, który przewyższa go w opublikowanych testach porównawczych Alibaba — ma ogółem 397 miliardów parametrów, z czego 17 miliardów jest aktywowanych na token, co stanowi prawie trzykrotność aktywnej liczby Flash-Next.

Najbardziej interesującym technicznie elementem jest nowatorska warstwa osadzająca w postaci N-gramów, zawierająca 51 miliardów parametrów. Warstwa przechowuje popularne grupy słów jako samodzielne wpisy w czymś, co Matthias Bastian z The Decoder określił jako rodzaj „słownika fraz”, dostarczającego informacje na poziomie frazy na początek sieci. Co najważniejsze, znajduje się on w zwykłej systemowej pamięci RAM, a nie w drogiej pamięci GPU, co zespół Qwen nazywa stosunkowo niskimi dodatkowymi kosztami — innowacja architektoniczna, która ma zostać wprowadzona w Qwen4.

Model natywnie obsługuje okno kontekstowe zawierające 262 144 tokenów i skaluje się do miliona tokenów przy użyciu rozszerzenia długiego kontekstu YaRN. Raport techniczny jest publikowany na GitHubie.

Benchmarki: kodowanie i praca biurowa

W testach Alibaba porównano Flash-Next z DeepSeek-V4-Flash (284 miliardy parametrów, 13 miliardów aktywnych) i Claude Opus 4.6 (Max) firmy Anthropic. Mimo że obaj rywale są znacznie więksi i drożsi, Flash-Next przoduje w większości testowanych zadań, zapewniając największy wzrost w zakresie kodowania i produktywności biurowej.

W kodowaniu agentycznym Flash-Next uzyskał 58,7 na DeepSWE 1.1 i 62,5 na SWE-bench Pro, pokonując zarówno DeepSeek-V4-Flash, jak i Claude Opus 4.6. Różnica w zadaniach biurowych jest jeszcze większa: 73,9 w CoWorkBench w porównaniu z 45,1 w DeepSeek-V4-Flash i 55,7 w JobBench — prawie dwukrotnie więcej niż 27,6 w Qwen3.7-Plus. Rozumowanie naukowe jest zbliżone w całej tej dziedzinie, przy czym Flash-Next ma wynik 91,7 na GPQA Diamond i 91,9 na LiveCodeBench v6. Claude Opus 4.6 wyprzedza jedynie ostatni egzamin Humanity z oceną 40,0 do 35,9 i jest starszym modelem Anthropic z lutego 2026 r. Jak zawsze opublikowane wyniki testów porównawczych i wydajność w świecie rzeczywistym mogą się różnić.

Presja cenowa na każdego rywala

Wersja produkcyjna jest dostarczana jako Qwen3.8-Flash za pośrednictwem QwenCloud, a jej cena wynosi 0,16 USD za milion tokenów wejściowych i 0,47 USD za milion tokenów wyjściowych. To podcina nawet GLM-5.3-Flash firmy Z.ai, wypuszczony tego samego dnia po cenach odpowiednio 0,15 i 0,50 dolara, co stanowi równowartość najniższej półki na rynku.

Przepaść w stosunku do flagowego statku Alibaby jest wyraźna. Qwen3.8-Max, wprowadzony na początku sierpnia, aby konkurować z Claude Opus 4.8, Gemini 3.1 Pro i GPT-5.6 Sol, kosztuje 2,00 dolara za milion tokenów wejściowych i 6,00 dolarów za milion tokenów wyjściowych. Według danych Alibaby Flash-Next radzi sobie nieco gorzej od flagowca, za mniej więcej jedną dwunastą ceny zarówno pod względem wejścia, jak i wyjścia.

Długi kontekst dodaje praktycznej wartości wykraczającej poza arkusz specyfikacji. Przy 262 144 tokenach natywnych pojedyncze żądanie może pomieścić kilka dużych repozytoriów kodu, pełny zestaw umów lub godziny transkrybowanych spotkań; rozszerzony do miliona tokenów za pomocą YaRN, analiza całego korpusu staje się możliwa bez rusztowania pobierania. W przypadku obciążeń związanych z kodowaniem agentycznym, w których Flash-Next osiąga najlepsze wyniki — niezależnie odnajduje i naprawia błędy w rzeczywistych projektach oprogramowania — duże okno oznacza mniej błędów w zarządzaniu kontekstem w trakcie wykonywania zadania. Zespół Qwen opublikował także raport techniczny na GitHubie, zachęcając do dokładnie tego rodzaju niezależnej kontroli architektury, której unikają zastrzeżone laboratoria.

Dlaczego ta wersja jest ważna

Qwen3.8-Flash-Next najlepiej rozumieć jako publiczną próbę generalną przed Qwen4. N-gramowa warstwa osadzająca, agresywny współczynnik parametrów aktywnych i odciążanie pamięci RAM nieporęcznych, ale rzadko potrzebnych parametrów, zarysowują filozofię projektowania: przenoś inteligencję za dolara, a nie inteligencję na procesor graficzny. Wyszkolenie najlepszego modelu Qwen3.7-Plus za jedną dziewiątą kosztów to właśnie zdolność, która sprawia, że ​​szybkie cykle iteracji są przystępne cenowo — a szybkość iteracji, bardziej niż jakikolwiek pojedynczy test porównawczy, decyduje o tym, kto za rok będzie na czele.

Jak zauważył FourWeekMBA, pojawienie się tego samego dnia dwóch przylegających do granicy modeli otwartej wagi z chińskich laboratoriów – GLM-5.3-Flash firmy Z.ai i Flash-Next firmy Alibaba – również oznacza zmianę rytmu. Zachodnie laboratoria w dalszym ciągu osiągają szczytowe wartości referencyjne, ale produkty o otwartej wadze są obecnie dostarczane co tydzień w jakości zbliżonej do granicznej, po cenach o rząd wielkości niższych.

Dla programistów praktyczny wniosek jest prosty: koszt wydajnego, wielomodalnego modelu o długim kontekście ponownie spadł, a ciężary do pobrania stanowią zabezpieczenie przed dowolnym dostawcą. Dla konkurencji wiadomość jest mniej komfortowa – granica wydajności przesuwa się obecnie szybciej, niż realistycznie mogą podążać ceny sztandarowych produktów, a Alibaba nie wykazuje żadnych oznak spowolnienia.

---

Wyprzedź sztuczną inteligencję

Otrzymuj najnowsze wiadomości, analizy i przełomowe informacje dotyczące sztucznej inteligencji — wszystko w jednym miejscu.

Przeczytaj więcej aktualności o sztucznej inteligencji →