В среду команда Qwen из Alibaba выпустила Qwen3.8-Flash-Next, мультимодальную модель, состоящую из смешанных специалистов, которая одновременно служит предварительной версией архитектуры будущего Qwen4 — и которая дает результаты, которые, по словам компании, превосходят ее гораздо более крупный Qwen3.7-Plus примерно за одну девятую стоимость обучения. Reuters, Bloomberg и The Decoder освещали запуск, в ходе которого Hugging Face и ModelScope получили открытые веса в тот же день, когда Z.ai выпустила свою собственную открытую модель, примыкающую к границам. Следите за последними новостями об искусственном интеллекте, поскольку гонка в открытом весе ускоряется.
Новая архитектура в миниатюре
Основная характеристика – эффективность. Qwen3.8-Flash-Next имеет 125 миллиардов параметров, но активирует только 6 миллиардов на каждый токен. Для сравнения, Qwen3.7-Plus — модель, которую она превосходит в опубликованных тестах Alibaba — имеет 397 миллиардов общих параметров, из которых 17 миллиардов активировано на каждый токен, что почти в три раза больше, чем у Flash-Next.
Самая технически интересная часть — это новый слой внедрения N-грамм, несущий 51 миллиард параметров. Слой хранит общие группы слов как отдельные записи в том, что Маттиас Бастиан из The Decoder назвал своего рода «словарём фраз», подавая информацию на уровне фраз в начало сети. Важно отметить, что он размещается в обычной системной оперативной памяти, а не в дорогой памяти графического процессора, что, как называет команда Qwen, требует относительно низких дополнительных затрат — архитектурное новшество, которое планируется перенести в Qwen4.
Модель изначально поддерживает контекстное окно из 262 144 токенов и масштабируется до одного миллиона токенов с использованием расширения длинного контекста YaRN. Технический отчет опубликован на GitHub.
Тесты: программирование и офисная работа
В тестах Alibaba Flash-Next сравнивается с DeepSeek-V4-Flash (284 миллиарда параметров, 13 миллиардов активных) и Claude Opus 4.6 (Max) от Anthropic. Несмотря на то, что оба конкурента намного крупнее и дороже, Flash-Next лидирует в большинстве протестированных задач, демонстрируя наибольший прирост в программировании и производительности офиса.
По агентному кодированию Flash-Next набрал 58,7 баллов на DeepSWE 1.1 и 62,5 баллов на SWE-bench Pro, опередив DeepSeek-V4-Flash и Claude Opus 4.6. Разрыв по офисным задачам еще больше: 73,9 на CoWorkBench против 45,1 у DeepSeek-V4-Flash и 55,7 на JobBench — почти вдвое больше, чем у Qwen3.7-Plus 27,6. Научные рассуждения практически совпадают во всех областях: Flash-Next имеет оценку 91,7 на GPQA Diamond и 91,9 на LiveCodeBench v6. Claude Opus 4.6 выходит вперед только на «Последнем экзамене человечества» с 40,0 до 35,9, и это более старая модель Anthropic, выпущенная в феврале 2026 года. Как всегда, опубликованные результаты тестов и реальная производительность могут отличаться.
Ценовое давление на каждого конкурента
Производственная версия поставляется как Qwen3.8-Flash через QwenCloud по цене 0,16 доллара США за миллион входных токенов и 0,47 доллара США за миллион выходных токенов. Это подрывает цену даже GLM-5.3-Flash от Z.ai, выпущенного в тот же день по цене 0,15 и 0,50 доллара соответственно — фактически паритет в нижней части рынка.
Разрыв с собственным флагманом Alibaba огромен. Qwen3.8-Max, представленный в начале августа для конкуренции с Claude Opus 4.8, Gemini 3.1 Pro и GPT-5.6 Sol, стоит 2 доллара США за миллион входных токенов и 6 долларов США за миллион выходных токенов. По данным Alibaba, Flash-Next работает чуть ниже флагмана, примерно в двенадцать раз дешевле как на входе, так и на выходе.
Длинный контекст добавляет практическую ценность помимо спецификации. При наличии 262 144 собственных токенов один запрос может содержать несколько крупных репозиториев кода, полный набор контрактов или часы записанных встреч; Расширенный до миллиона токенов с помощью YaRN, анализ всего корпуса становится возможным без поисковых лесов. Для рабочих нагрузок агентного кодирования, где Flash-Next показывает свои самые высокие результаты — независимый поиск и исправление ошибок в реальных проектах программного обеспечения — большое окно означает меньше ошибок управления контекстом в середине задачи. Команда Qwen также опубликовала технический отчет на GitHub, приглашая к независимому анализу архитектуры, которого избегают частные лаборатории.
Почему этот выпуск важен
Qwen3.8-Flash-Next лучше всего понимать как публичную генеральную репетицию Qwen4. Слой внедрения N-грамм, агрессивное соотношение активных параметров и разгрузка ОЗУ громоздких, но редко необходимых параметров обрисовывают философию дизайна: перемещайте интеллект на доллар, а не интеллект на графический процессор. Обучение модели, превосходящей Qwen3.7-Plus, за одну девятую часть стоимости — это именно та возможность, которая делает доступным быстрые циклы итераций, а скорость итерации, больше, чем любой отдельный эталон, — это то, что решает, кто будет стоять на переднем крае через год.
Появление в тот же день двух соседних моделей открытого веса из китайских лабораторий — GLM-5.3-Flash от Z.ai и Flash-Next от Alibaba — также знаменует собой сдвиг ритма, как заметил FourWeekMBA. Западные лаборатории по-прежнему удерживают эталонные пики, но уровень открытого веса теперь поставляется еженедельно с почти граничным качеством по ценам на порядок ниже.
Для разработчиков практический вывод прост: стоимость работоспособной, мультимодальной модели с длительным контекстом только что снова упала, а загружаемые веса служат страховкой от любого отдельного поставщика. Для конкурентов это послание менее комфортно: граница эффективности сейчас движется быстрее, чем реально можно последовать за ценообразованием флагманских компаний, и Alibaba не проявляет никаких признаков замедления.
---
Будьте впереди ИИПолучайте последние новости, анализ и открытия в области искусственного интеллекта — все в одном месте.
Подробнее новости AI →