Малоизвестный проект с открытым исходным кодом под названием Strata переживает настоящий момент. Движок с лицензией MIT, который запускает Qwen3.8-Flash-Next от Alibaba — модель, состоящую из 125 миллиардов параметров — на обычных игровых ПК, попал на первую страницу Hacker News 4 октября с более чем 640 баллами, а его репозиторий GitHub собрал более 11 000 звезд с момента его создания 24 сентября.

Идея проста: модель со 125 миллиардами параметров, которая обычно находится на сервере, может общаться, писать код, читать изображения и управлять агентами кодирования полностью на потребительской видеокарте, при этом ничего не покидая машины.

Что на самом деле делает Strata

Strata — это одновременно механизм вывода и установщик в один клик для Windows и Linux. Согласно его документации, требования скромны по стандартам передовых моделей: графический процессор с не менее 12 ГБ видеопамяти NVIDIA RTX 20, 30, 40 или 50 серий или AMD Radeon RX 6000, 7000 или 9000 серии, не менее 32 ГБ системной оперативной памяти и примерно 80 ГБ свободного места на SSD.

Движок поставляется с квантованными версиями Qwen3.8-Flash-Next с несколькими уровнями сжатия, от Q2_0 до IQ3_S, а также вариант, специализирующийся на коде. Он предоставляет API-интерфейсы, совместимые с OpenAI и Anthropic, на локальном хосте, что означает, что инструменты, созданные для ChatGPT или Claude, включая агенты кодирования, такие как Claude Code, Cursor и Codex, могут быть направлены на локальный сервер с минимальными изменениями. Включены дополнительный ввод изображения и поддержка нескольких графических процессоров, а программа установки даже предлагает режим настройки с помощью искусственного интеллекта, который позволяет помощнику по программированию настроить машину с помощью одной вставленной подсказки.

Цифры скорости

Опубликованные тесты проекта, измеренные на двух потребительских настольных компьютерах, стали причиной распространения релиза. Strata сообщает, что на NVIDIA RTX 5070 с 12 ГБ видеопамяти в сочетании с Ryzen 5 7600 и 64 ГБ ОЗУ:

  • Квантование Q2_0: 94 токена в секунду для генерации и 2650 токенов в секунду для быстрой обработки документа объемом 32 000 токенов.
  • IQ3_S: 53 токена в секунду, обработка запросов 1620 токенов в секунду.
  • Вариант кодера: 55 токенов за второе поколение.

Со стороны AMD RX 9070 XT с 16 ГБ видеопамяти обрабатывал 60 токенов в секунду в Q2_0. По оценкам документации, RTX 3090 с 24 ГБ видеопамяти должен обрабатывать от 100 до 140 токенов в секунду — быстрее, чем большинство людей могут прочитать.

Для сравнения: шесть месяцев назад для локального запуска даже модели с плотностью в 70 миллиардов параметров на приемлемой скорости требовалась рабочая станция с сотнями гигабайт унифицированной памяти или агрессивные методы спекулятивного декодирования.

Почему модель 125B подходит для игровой карты

Две технологии делают это возможным. Во-первых, это сама модель. Как рассказал AI Buzz Wire в своем выпуске, Qwen3.8-Flash-Next представляет собой архитектуру, созданную совместными усилиями экспертов, с примерно 125 миллиардами общих параметров, но только около 6 миллиардов активных на токен — поэтому каждое сгенерированное слово затрагивает небольшой участок сети, что резко сокращает объем вычислений на токен.

Второе — квантование. Самые быстрые пресеты Strata сжимают веса модели до двух или трех битов на параметр, жертвуя некоторой точностью ради занимаемой площади, которая умещается в 12 ГБ графического процессора и системной оперативной памяти. Этот компромисс является основным предостережением: кванты классов Q2 и IQ2 заметно снижают качество выполнения задач, требующих большого количества рассуждений, и покупатели должны рассматривать заголовки показателей скорости как отправную точку, а не как гарантию для каждой рабочей нагрузки. На страницах тестов сообщества в репозитории отслеживаются результаты качества для разных размеров.

Часть большой волны локального искусственного интеллекта

Strata появляется на фоне ускоряющегося импульса для локальных выводов. Семейство Qwen от Alibaba стало самой загружаемой линейкой моделей с открытым исходным кодом, Meta и Google имеют собственные конкурентоспособные модели с открытым исходным кодом, а волна инструментов теперь позволяет потребителям запускать способных помощников без подписки или данных, покидающих их устройства.

Проект также отражает изменение определения «потребительского оборудования». Видеокарта среднего класса 2026 года с 12 ГБ видеопамяти, которая поставлялась в основном для игр, теперь является жизнеспособным ускорителем вывода для модели в том классе размеров, который определял передовые системы всего два года назад.

Strata остается ранним программным обеспечением — система отслеживания проблем в репозитории документирует неровности старых графических процессоров и процессоров, отличных от AVX2, — но проект имеет лицензию MIT, бесплатный и разрабатывается открыто, с экспериментальной поддержкой Intel Arc, старых карт Tesla и Radeon, а также установок с несколькими графическими процессорами, задокументированных членами сообщества.

Для разработчиков наиболее практичным выводом может стать совместимость API локального хоста: любой скрипт или агент, написанный с использованием OpenAI или Anthropic SDK, можно перенаправить в локальное развертывание Qwen путем изменения базового URL-адреса, что делает Strata простым вариантом для прототипирования с учетом конфиденциальности, автономного использования или просто ограничения расходов на API.

Как попробовать

Для начала работы не требуется терминальная сессия с руководством. Установщик предоставляет драйверы, веса модели и локальный сервер за один проход, а репозиторий содержит установочный файл, предназначенный для вставки непосредственно в помощник по кодированию AI, который затем настраивает машину автономно. Первые запуски происходят медленнее, пока веса загружаются с диска; в документации рекомендуется использовать твердотельный накопитель и предупреждается, что долгие разговоры перекладывают большую часть работы на системную оперативную память.

Оставайтесь впереди искусственного интеллекта

Следите за AI Buzz Wire, чтобы быть в курсе последних новостей о моделях с открытым исходным кодом, местных инструментах искусственного интеллекта и оборудовании для вывода.

Читать больше новостей об искусственном интеллекте →