Команда Alibaba Qwen випустила Qwen3.8-Flash-Next у середу, мультимодальну суміш експертів, яка одночасно є попереднім переглядом архітектури майбутнього Qwen4 — і забезпечує результати, які, за словами компанії, перевершують набагато більший Qwen3.7-Plus приблизно в одну дев’яту вартості навчання. Reuters, Bloomberg і The Decoder висвітлювали запуск, який ставить відкриті ваги на Hugging Face і ModelScope того самого дня, коли Z.ai відправив свою власну відкриту модель, прилеглу до кордону. Слідкуйте за найважливішими новинами штучного інтелекту, оскільки гонка у відкритій вазі прискорюється.

Нова архітектура в мініатюрі

Специфікація заголовка — ефективність. Qwen3.8-Flash-Next має 125 мільярдів параметрів, але активує лише 6 мільярдів на маркер. Для порівняння, Qwen3.7-Plus — модель, яку вона перевершує в опублікованих тестах Alibaba — має 397 мільярдів параметрів із 17 мільярдами активованих на токен, що майже втричі перевищує активну кількість Flash-Next.

Найцікавішим з технічної точки зору є новий шар вбудовування N-грам, який містить 51 мільярд параметрів. Рівень зберігає загальні групи слів як окремі записи в тому, що Маттіас Бастіан з The Decoder назвав своєрідним «словником фраз», що передає інформацію на рівні фрази на початок мережі. Важливо те, що він розміщений у звичайній системній оперативній пам’яті, а не в дорогій пам’яті графічного процесора, за що команда Qwen називає відносно низьку додаткову вартість — архітектурне нововведення, яке планується впровадити в Qwen4.

Модель спочатку підтримує контекстне вікно з 262 144 маркерами та масштабується до одного мільйона маркерів за допомогою розширення довгого контексту YaRN. Технічний звіт опубліковано на GitHub.

Бенчмарки: кодування та офісна робота

Тести Alibaba порівнюють Flash-Next з DeepSeek-V4-Flash (284 мільярди параметрів, 13 мільярдів активних) і Claude Opus 4.6 (макс.) від Anthropic. Незважаючи на те, що обидва конкуренти набагато більші або дорожчі, Flash-Next лідирує в більшості перевірених завдань, маючи найбільший приріст у кодуванні та офісній продуктивності.

Що стосується агентського кодування, Flash-Next набрав 58,7 на DeepSWE 1.1 і 62,5 на SWE-bench Pro, перемігши як DeepSeek-V4-Flash, так і Claude Opus 4.6. Розрив в офісних завданнях ще більший: 73,9 на CoWorkBench проти 45,1 для DeepSeek-V4-Flash і 55,7 на JobBench — майже вдвічі більше, ніж у Qwen3.7-Plus 27,6. Наукові міркування тісно збігаються в усіх сферах: Flash-Next має 91,7 на GPQA Diamond і 91,9 на LiveCodeBench v6. Claude Opus 4.6 виходить тільки вперед на Останньому іспиті Humanity, від 40,0 до 35,9, і це старіша модель Anthropic з лютого 2026 року. Як завжди, опубліковані показники тестів і продуктивність у реальному світі можуть відрізнятися.

Ціновий тиск на кожного конкурента

Виробнича версія поставляється як Qwen3.8-Flash через QwenCloud за ціною 0,16 дол. США за мільйон вхідних токенів і 0,47 дол. США за мільйон вихідних токенів. Це підриває навіть GLM-5.3-Flash від Z.ai, випущений того ж дня за $0,15 і $0,50 відповідно — фактично паритет у нижній частині ринку.

Розрив із власним флагманом Alibaba суттєвий. Qwen3.8-Max, представлений на початку серпня, щоб конкурувати з Claude Opus 4.8, Gemini 3.1 Pro і GPT-5.6 Sol, коштує $2,00 за мільйон вхідних токенів і $6,00 за мільйон вихідних токенів. Згідно з даними Alibaba, Flash-Next працює трохи нижче, ніж флагман, приблизно в одну дванадцяту ціни як на вході, так і на виході.

Довгий контекст додає практичну цінність за межі специфікації. При 262 144 нативних жетонах один запит може містити кілька великих сховищ коду, повний набір контрактів або години транскрибованих зустрічей; розширено до одного мільйона токенів за допомогою YaRN, аналіз усього корпусу стає здійсненним без використання каркасів для пошуку. Для робочих навантажень агентного кодування, де Flash-Next публікує найсильніші результати — незалежний пошук і виправлення помилок у реальних проектах програмного забезпечення — велике вікно означає менше збоїв керування контекстом під час виконання завдання. Команда Qwen також опублікувала технічний звіт на GitHub, запрошуючи саме до незалежної перевірки архітектури, якої уникають пропрієтарні лабораторії.

Чому цей випуск важливий

Qwen3.8-Flash-Next краще розуміти як публічну генеральну репетицію Qwen4. Рівень вбудовування N-грамів, агресивне співвідношення активних параметрів і розвантаження оперативної пам’яті громіздких, але рідко потрібних параметрів окреслюють філософію дизайну: інтелект за долар, а не інтелект за GPU. Навчання моделі, що перевершує Qwen3.7-Plus, за одну дев’яту вартості — це саме та можливість, яка робить швидкі цикли ітерації доступними — і швидкість ітерації, більше ніж будь-який окремий тест, є тим, що вирішить, хто буде стояти на кордоні через рік.

За словами FourWeekMBA, надходження в той же день двох відкритих моделей із китайських лабораторій — GLM-5.3-Flash від Z.ai та Flash-Next від Alibaba — також знаменує зміну каденції. Західні лабораторії все ще тримаються на вершині еталонних показників, але відкрита вага тепер щотижня постачає майже передову якість за цінами на порядок нижчими.

Для розробників практичний висновок простий: вартість потужної мультимодальної моделі з довгим контекстом знову впала, із завантажуваними вагами як страхування від будь-якого окремого постачальника. Для конкурентів це повідомлення менш комфортне — межа ефективності зараз рухається швидше, ніж реалістично може слідувати ціноутворення на флагмани, і Alibaba не демонструє жодних ознак сповільнення.

---

Будьте попереду ШІ

Отримуйте останні новини штучного інтелекту, аналіз і прориви — усе в одному місці.

Читати більше новин AI →