Загадочная модель, которая неделю очаровывала разработчиков под анонимным именем Ox Alpha, теперь имеет официальную личность. Китайская компания Z.AI выпустила GLM-5.3-Flash, мультимодальную модель с открытым весом, выпущенную под разрешительной лицензией MIT, и компания заявляет, что весь предварительный просмотр стелса выполнялся на чипах искусственного интеллекта китайского производства. Запуск завершает одну из самых популярных игр-угаданий в индустрии искусственного интеллекта в этом году. Дополнительную информацию о том, как разворачивалась эта история, можно найти в нашей статье последние разработки в области искусственного интеллекта.
Что на самом деле отправил Z.ai
GLM-5.3-Flash — это смешанная экспертная модель с 320 миллиардами общих параметров и 18 миллиардами активных параметров — заметное снижение по сравнению с 32 миллиардами активных параметров его предшественника GLM-4.5. Согласно объявлению Z.ai, это первая мультимодальная модель в семействе GLM-5, принимающая ввод текста и изображений, а также поддерживающая контекстное окно, охватывающее один миллион токенов.
Модель была обучена на мультимодальном корпусе из 30 триллионов токенов, и в ее архитектуре линейное внимание к локальным зависимостям сочетается с редким вниманием к глобальному контексту. Компонент Z.ai, вызываемый IndexPool, сжимает группы векторов ключей индексатора, чтобы ограничить задержку и использование памяти при большой длине контекста. Компания сообщает о трехкратном уменьшении объема вычислений и уменьшении размера KV-кэша в 4,4 раза по сравнению с GLM-5.3.
Заявления и цены на эталонные тесты
В индексе интеллекта искусственного анализа версии 4.1.1 GLM-5.3-Flash набрал 57 баллов — этот показатель ставит его на вершину текущего рейтинга моделей искусственного анализа, что значительно выше медианного показателя сравнения, равного 18. Z.ai утверждает, что он превосходит GLM-5.2 по заявленным показателям кодирования и агентным тестам, но на одну десятую дешевле, и приближается к Claude Opus 4.8 от Anthropic по внутреннему тесту кодирования. На DeepSWE v1.1 модель набрала 63,4 балла против 46,2 у GLM-5.2; на AutomationBench он достиг 48,8 против 26,2. Как отмечает TestingCatalog, различные средства оценки, ограничения контекста и настройки генерации означают, что сравнения перекрестных тестов сильно зависят от каждой настройки.
По данным Artificial Analysis, цена позиционирует модель как агрессивно дешевую: 0,15 доллара за миллион входных токенов и 0,50 доллара за миллион выходных токенов со скидкой 83% на кэширование подсказок. Z.ai указывает сниженную стоимость в размере 0,045 доллара США за задачу индекса интеллекта.
Китайский угол чипа
Наиболее стратегически значимой деталью является инфраструктура, а не разведка. Перед запуском модель анонимно работала на OpenRouter и OpenCode под именем ox-alpha, начиная с 20 августа, и Z.ai говорит, что она стала самой популярной моделью недели в этих сервисах — трафик полностью обслуживался отечественными китайскими ускорителями. Чтобы поддержать это, Z.ai создал стек обслуживания на основе SGLang, который разделяет кодирование, предварительное заполнение и декодирование, сообщая о трехкратном увеличении производительности сквозного обслуживания на десятках тысяч китайских ИИ-чипов.
Это имеет значение не только для одного поставщика. Это публичная демонстрация того, что передовая китайская модель может обслуживаться в больших масштабах без оборудования Nvidia, и западные политики и производители чипов не будут игнорировать этот факт. The New Stack охарактеризовал этот релиз как дешевый, хороший и работающий на китайских чипах — три качества, о которых до сих пор редко заявляли вместе.
Открытые веса, реальное развертывание
Веса доступны на Hugging Face по лицензии MIT, а локальное развертывание поддерживается через SGLang, vLLM и TokenSpeed. Подписчики GLM Coding Plan сразу же получают GLM-5.3-Flash в реальном времени с квотой, в три раза большей, чем GLM-5.3, а его мультимодальные возможности раскрываются в ZCode посредством интеграции использования браузера и использования компьютера.
Визуальное мышление играет центральную роль в выпуске: Z.ai научил модель проверять визуализированные интерфейсы, игровой процесс и 3D-вывод, а затем оценивать и пересматривать свою собственную работу на основе визуальной обратной связи. Тот же подход распространяется на документы, электронные таблицы, презентации и информационные панели — обычные артефакты офисной работы, и именно здесь конкурент Qwen, выпущенный в тот же день, также заявляет о своих самых больших успехах.
Решение об открытых весах имеет значение не только для любителей. Лицензирование MIT является наиболее либеральной распространенной лицензией в сфере ИИ: коммерческое использование, модификация и распространение не несут никаких обязательств по авторскому левому. Независимые хосты могут обслуживать GLM-5.3-Flash на своем собственном оборудовании, точно настраивать его для вертикалей, от юридической проверки до промышленной автоматизации, и встраивать его в продукты без согласования условий — опция, закрытая передовыми моделями, использующими только API.
Почему скрытый запуск сработал
Анонимное внедрение дало Z.ai то, чего не могут купить маркетинговые бюджеты: независимую от бренда валидацию. Разработчики приняли Ox Alpha с учетом его достоинств, без противопоставления китайской лаборатории традиционным американским компаниям. К тому времени, как агентство Bloomberg подтвердило, что Z.AI является производителем, а Business Insider заявило, что «загадка раскрыта», модель уже возглавила списки лидеров сообщества на нейтральной территории.
Конкурентное давление теперь очевидно. Мультимодальная модель с контекстом в один миллион токенов, весами, лицензированными MIT, и ценами на продукцию ниже доллара вынуждает каждого действующего игрока обосновывать свой прайс-лист. Граница Парето для соотношения цены и производительности — компромисс, который на самом деле считают разработчики, — была перерисована, как выразился широко популярный комментатор ИИ Эндрю Карран на X.
Открытым остается вопрос долговечности: выдержат ли эталонные тесты испытания в условиях враждебного реального использования и как быстро западные лаборатории отреагируют на цену. В любом случае, неделя анонимных спекуляций закончилась названной моделью, загружаемыми весами и обслуживающим парком, в котором не используется американский кремний.
---
Будьте впереди ИИПолучайте последние новости, анализ и открытия в области искусственного интеллекта — все в одном месте.
Подробнее новости AI →