Mało znany projekt open source o nazwie Strata ma swój moment. Silnik na licencji MIT, na którym działa Qwen3.8-Flash-Next firmy Alibaba — model będący mieszanką ekspertów o 125 miliardach parametrów — na zwykłych komputerach PC do gier, trafił na pierwszą stronę Hacker News 4 października z ponad 640 punktami, a jego repozytorium GitHub zgromadziło ponad 11 000 gwiazdek od czasu jego utworzenia 24 września.

Zasada jest prosta: model o 125 miliardach parametrów, który zwykle znajduje się na serwerze, może czatować, pisać kod, czytać obrazy i sterować agentami kodującymi całkowicie na konsumenckiej karcie graficznej, bez konieczności opuszczania maszyny.

Co właściwie robi Strata

Strata to zarówno silnik wnioskowania, jak i instalator jednym kliknięciem dla systemów Windows i Linux. Według dokumentacji wymagania są skromne jak na standardy pionierskich modeli: procesor graficzny z co najmniej 12 GB pamięci VRAM z serii RTX 20, 30, 40 lub 50 firmy NVIDIA lub AMD Radeon RX z serii 6000, 7000 lub 9000, co najmniej 32 GB systemowej pamięci RAM i około 80 GB wolnego miejsca na dysku SSD.

Silnik dostarcza skwantyzowane wersje Qwen3.8-Flash-Next na kilku poziomach kompresji, od Q2_0 do IQ3_S, a także wariant wyspecjalizowany w kodzie. Udostępnia interfejsy API zgodne z OpenAI i Anthropic na serwerze lokalnym, co oznacza, że ​​narzędzia zbudowane dla ChatGPT lub Claude — w tym agenty kodujące, takie jak Claude Code, Cursor i Codex — można skierować na lokalny serwer przy minimalnych zmianach. Dostępne jest opcjonalne wejście obrazu i obsługa wielu procesorów graficznych, a instalator oferuje nawet tryb konfiguracji wspomagany sztuczną inteligencją, który pozwala asystentowi kodowania skonfigurować maszynę za pomocą jednego wklejonego monitu.

Liczby prędkości

Opublikowane w ramach projektu testy porównawcze, zmierzone na dwóch komputerach konsumenckich, są powodem rozprzestrzenienia się tej wersji. Na karcie NVIDIA RTX 5070 z 12 GB pamięci VRAM w połączeniu z Ryzen 5 7600 i 64 GB pamięci RAM Strata podaje:

  • Kwantyzacja Q2_0: 94 tokeny na sekundę przy generowaniu i 2650 tokenów na sekundę przy szybkim przetwarzaniu dokumentu zawierającego 32 tys. tokenów
  • IQ3_S: 53 tokeny na drugą generację, 1620 tokenów na sekundę natychmiastowego przetwarzania
  • Wariant kodera: 55 tokenów na drugą generację

Po stronie AMD RX 9070 XT z 16 GB pamięci VRAM zarządzał 60 tokenami na sekundę w Q2_0. W dokumentacji szacuje się, że RTX 3090 z 24 GB pamięci VRAM powinien osiągnąć od 100 do 140 tokenów na sekundę — szybciej niż większość ludzi jest w stanie odczytać.

Dla porównania, sześć miesięcy temu lokalne uruchomienie nawet gęstego modelu o 70 miliardach parametrów przy możliwych do wykorzystania prędkościach wymagało stacji roboczej z setkami gigabajtów zunifikowanej pamięci lub agresywnych, spekulacyjnych sztuczek dekodujących.

Dlaczego model 125B pasuje do karty do gier

Umożliwiają to dwie technologie. Pierwszą z nich jest sam model. Jak omówiono w momencie premiery AI Buzz Wire, Qwen3.8-Flash-Next jest architekturą złożoną z ekspertów, zawierającą około 125 miliardów parametrów ogółem, ale tylko około 6 miliardów aktywnych na token — zatem każde wygenerowane słowo dotyka małego wycinka sieci, radykalnie zmniejszając moc obliczeniową przypadającą na token.

Drugim jest kwantyzacja. Najszybsze ustawienia wstępne Straty kompresują wagę modelu do dwóch lub trzech bitów na parametr, zamieniając pewną dokładność na rozmiar mieszczący się w 12 GB procesorze graficznym i systemowej pamięci RAM. Ten kompromis jest głównym zastrzeżeniem: kwantyfikatory klasy Q2 i IQ2 w wymierny sposób pogarszają jakość zadań wymagających intensywnego rozumowania, a kupujący powinni traktować główne wartości prędkości jako punkt wyjścia, a nie gwarancję dla każdego obciążenia. Strony testów porównawczych społeczności w repozytorium śledzą wyniki jakości w różnych rozmiarach.

Część większej fali lokalnej sztucznej inteligencji

Strata pojawia się w obliczu rosnącego impetu lokalnego wnioskowania. Rodzina Qwen firmy Alibaba stała się najczęściej pobieraną linią modeli o otwartej wadze, Meta i Google mają własne, konkurencyjne modele o otwartym kodzie źródłowym, a fala narzędzi pozwala teraz konsumentom uruchamiać zdolnych asystentów bez subskrypcji i danych opuszczających ich urządzenia.

Projekt odzwierciedla także zmiany w definicji „sprzętu konsumenckiego”. Karta graficzna średniej klasy na rok 2026 z 12 GB pamięci VRAM, dostarczana głównie do gier, jest obecnie realnym akceleratorem wnioskowania dla modelu w tej klasie wielkości, która zaledwie dwa lata temu zdefiniowała pionierskie systemy.

Strata to wczesne oprogramowanie — narzędzie do śledzenia problemów w repozytorium dokumentuje problemy ze starszymi procesorami graficznymi i procesorami innymi niż AVX2 — ale projekt jest objęty licencją MIT, bezpłatny i opracowany jako otwarty, z eksperymentalną obsługą procesorów Intel Arc, starszych kart Tesla i Radeon oraz platform z wieloma procesorami graficznymi udokumentowanymi przez członków społeczności.

Dla programistów najbardziej praktycznym rozwiązaniem może być zgodność z API localhost: dowolny skrypt lub agent napisany dla OpenAI lub Anthropic SDK można przekierować do lokalnego wdrożenia Qwen, zmieniając podstawowy adres URL, dzięki czemu Strata jest opcją o niskim tarciu do prototypowania wrażliwego na prywatność, używania w trybie offline lub po prostu ograniczania wydatków na API.

Jak tego spróbować

Rozpoczęcie pracy nie wymaga sesji terminalowej z instrukcją. Instalator dostarcza sterowniki, wagi modeli i lokalny serwer w jednym przebiegu, a repozytorium zawiera plik instalacyjny przeznaczony do wklejenia bezpośrednio do asystenta kodowania AI, który następnie samodzielnie konfiguruje maszynę. Pierwsze starty są wolniejsze przy ładowaniu ciężarków z dysku; dokumentacja zaleca dysk SSD i ostrzega, że ​​długie rozmowy powodują przeniesienie większej ilości pracy na systemową pamięć RAM.

Wyprzedź sztuczną inteligencję

Śledź AI Buzz Wire, aby uzyskać najnowsze informacje na temat modeli open source, lokalnych narzędzi AI i sprzętu do wnioskowania.

Przeczytaj więcej aktualności o sztucznej inteligencji →