Маловідомий проект із відкритим вихідним кодом під назвою Strata переживає момент. Ліцензований MIT движок, який запускає Qwen3.8-Flash-Next від Alibaba — 125-мільярдну модель експертів — на звичайних ігрових комп’ютерах, вийшов на першу сторінку Hacker News 4 жовтня з понад 640 балами, а його репозиторій GitHub зібрав понад 11 000 зірок з моменту створення 24 вересня.

Подача проста: модель зі 125 мільярдами параметрів, яка зазвичай живе на сервері, може спілкуватися, писати код, читати зображення та керувати агентами кодування повністю на споживчій графічній карті, нічого не залишаючи машину.

Що насправді робить Strata

Strata — це механізм висновків і інсталятор одним клацанням миші для Windows і Linux. Згідно з його документацією, вимоги скромні за стандартами передових моделей: графічний процесор із принаймні 12 ГБ відеопам’яті від NVIDIA RTX 20, 30, 40 або 50 серій або AMD Radeon RX 6000, 7000 або 9000 серії, принаймні 32 ГБ системної оперативної пам’яті та приблизно 80 ГБ вільного місця на SSD.

Механізм постачає квантовані версії Qwen3.8-Flash-Next на кількох рівнях стиснення, від Q2_0 до IQ3_S, а також спеціалізований на коді варіант. Він надає OpenAI та Anthropic-сумісні API на локальному хості, тобто інструменти, створені для ChatGPT або Claude, включаючи агенти кодування, як-от Claude Code, Cursor і Codex, можна спрямовувати на локальний сервер із мінімальними змінами. Включено додаткове введення зображень і підтримку кількох графічних процесорів, а інсталятор навіть пропонує режим налаштування за допомогою штучного інтелекту, який дозволяє помічнику кодування налаштувати машину за допомогою однієї вставленої підказки.

Числа швидкості

Опубліковані тести проекту, виміряні на двох споживчих настільних ПК, є причиною поширення випуску. На NVIDIA RTX 5070 із 12 ГБ відеопам’яті в поєднанні з Ryzen 5 7600 і 64 ГБ оперативної пам’яті Strata повідомляє:

  • Квантування Q2_0: 94 маркери на секунду для генерації та 2650 маркерів на секунду для оперативної обробки документа розміром 32 КБ.
  • IQ3_S: 53 маркери на секунду покоління, 1620 маркерів на секунду швидка обробка
  • Варіант кодера: 55 токенів на друге покоління

З боку AMD, RX 9070 XT із 16 ГБ відеопам’яті керував 60 токенами на секунду в Q2_0. Згідно з документацією, RTX 3090 із 24 ГБ відеопам’яті має досягати від 100 до 140 токенів на секунду — швидше, ніж може прочитати більшість людей.

Для порівняння: шість місяців тому для локального запуску навіть щільної моделі з 70 мільярдами параметрів на доступній швидкості потрібна була робоча станція з сотнями гігабайт уніфікованої пам’яті або агресивні спекулятивні прийоми декодування.

Чому модель 125B підходить для ігрової карти

Це можливо завдяки двом технологіям. По-перше, це сама модель. Як зазначав AI Buzz Wire під час випуску, Qwen3.8-Flash-Next — це суміш експертних архітектур із приблизно 125 мільярдами параметрів, але лише близько 6 мільярдів активних на маркер — тому кожне згенероване слово стосується невеликої частини мережі, значно скорочуючи обчислення на маркер.

Другий – квантування. Найшвидші пресети Strata стискають ваги моделі до двох-трьох бітів на параметр, обмінюючи деяку точність на розмір, який відповідає 12 ГБ графічного процесора та системної оперативної пам’яті. Цей компроміс є головним застереженням: кількісні показники класів Q2 і IQ2 помітно погіршують якість виконання важких завдань, тому покупці повинні розглядати заголовні цифри швидкості як відправну точку, а не як гарантію для кожного робочого навантаження. Сторінки тестування спільноти в репозиторії відстежують результати якості в різних розмірах.

Частина більшої хвилі локального ШІ

Strata надходить на тлі прискорення імпульсу для локального висновку. Сімейство Qwen від Alibaba стало найбільш завантажуваною лінійкою відкритих моделей, Meta та Google мають власні конкурентоспроможні моделі з відкритим вихідним кодом, а хвиля інструментів тепер дозволяє споживачам запускати потужних помічників без підписки або даних, що залишають їхні пристрої.

Проект також відображає те, як змінюється визначення «споживчого апаратного забезпечення». Відеокарта середнього класу 2026 із 12 ГБ відеопам’яті, яка поставлялася в основному для ігор, тепер є життєздатним прискорювачем висновків для моделі в класі розмірів, який визначив передові системи лише два роки тому.

Strata залишається раннім програмним забезпеченням — засіб відстеження проблем у сховищі документує грубі краї на старих графічних процесорах і процесорах, що не належать до AVX2 — але проект має ліцензію Массачусетського технологічного інституту, є безкоштовним і розробляється відкрито, з експериментальною підтримкою для Intel Arc, старіших карт Tesla та Radeon, а також багатографічних установок, задокументованих членами спільноти.

Для розробників найпрактичнішим висновком може бути сумісність API локального хосту: будь-який сценарій або агент, написаний для OpenAI або Anthropic SDK, можна перенаправити в локальне розгортання Qwen, змінивши базову URL-адресу, що робить Strata варіантом із низьким рівнем тертя для створення прототипів, чутливих до конфіденційності, використання в автономному режимі або просто обмеження витрат на API.

Як спробувати

Початок роботи не вимагає термінального сеансу з посібником. Інсталятор надає драйвери, ваги моделі та локальний сервер за один прохід, а репозиторій містить файл налаштування, призначений для вставлення безпосередньо в помічник кодування AI, який потім налаштовує машину автономно. Перші запуски відбуваються повільніше, поки ваги завантажуються з диска; документація рекомендує SSD і попереджає, що довгі розмови перекладають більше роботи на системну оперативну пам’ять.

Будьте попереду ШІ

Слідкуйте за AI Buzz Wire, щоб дізнатися про останні новини про моделі з відкритим кодом, місцеві інструменти штучного інтелекту та апаратне забезпечення для висновків.

Читати більше новин AI →