Málo známý open-source projekt s názvem Strata má chvilku. Engine s licencí MIT, který provozuje Alibaba Qwen3.8-Flash-Next – model se 125 miliardami parametrů pro směs expertů – na běžných herních počítačích, se dostal na titulní stránku Hacker News 4. října s více než 640 body a jeho úložiště GitHub od září nasbíralo přes 11 2400 hvězdiček.

Základní myšlenka je jednoduchá: model se 125 miliardami parametrů, který normálně žije na serveru, může chatovat, psát kód, číst obrázky a řídit kódovací agenty zcela na spotřebitelské grafické kartě, aniž by nic opustilo počítač.

Co Strata vlastně dělá

Strata je jak inferenční engine, tak instalační program na jedno kliknutí pro Windows a Linux. Podle jeho dokumentace jsou požadavky skromné ​​podle standardů hraničních modelů: GPU s alespoň 12 GB VRAM z řady NVIDIA RTX 20, 30, 40 nebo 50 nebo Radeon RX 6000, 7000 nebo 9000 od AMD, alespoň 32 GB systémové paměti RAM a zhruba 8 GB volného místa SSD.

Motor dodává kvantované verze Qwen3.8-Flash-Next v několika úrovních komprese, od Q2_0 až po IQ3_S, plus variantu specializovanou na kód. Odhaluje OpenAI a rozhraní API kompatibilní s Anthropic na localhost, což znamená, že nástroje vytvořené pro ChatGPT nebo Claude – včetně kódovacích agentů, jako je Claude Code, Cursor a Codex – lze nasměrovat na místní server s minimálními změnami. K dispozici je volitelný obrazový vstup a podpora více GPU a instalační program dokonce nabízí režim nastavení za pomoci umělé inteligence, který umožňuje asistentovi kódování nakonfigurovat počítač pomocí jediné vložené výzvy.

Čísla rychlosti

Důvodem rozšíření vydání jsou publikované benchmarky projektu, měřené na dvou spotřebitelských počítačích. Na NVIDIA RTX 5070 s 12 GB VRAM spárované s Ryzen 5 7600 a 64 GB RAM, Strata uvádí:

  • Q2_0 kvantizace: 94 tokenů za sekundu pro generování a 2 650 tokenů za sekundu pro rychlé zpracování na dokumentu s 32 000 tokeny
  • IQ3_S: 53 tokenů za druhou generaci, rychlé zpracování 1 620 tokenů za sekundu
  • Varianta kodéru: 55 tokenů za druhou generaci

Na straně AMD zvládal RX 9070 XT s 16GB VRAM 60 tokenů za sekundu v Q2_0. Dokumentace odhaduje, že RTX 3090 s 24 GB VRAM by měla dosáhnout 100 až 140 tokenů za sekundu – rychleji, než dokáže většina lidí číst.

Pro srovnání, před šesti měsíci vyžadoval místní provoz dokonce i modelu s hustotou 70 miliard parametrů při použitelných rychlostech pracovní stanici se stovkami gigabajtů jednotné paměti nebo agresivní spekulativní dekódovací triky.

Proč se model 125B hodí na herní kartu

Dvě technologie to umožňují. První je samotný model. Jak popsala AI Buzz Wire ve svém vydání, Qwen3.8-Flash-Next je architektura směsi odborníků se zhruba 125 miliardami celkových parametrů, ale pouze asi 6 miliardami aktivních na token – takže každé vygenerované slovo se dotkne malého výseku sítě, což dramaticky sníží výpočet na token.

Druhým je kvantování. Nejrychlejší předvolby Strata komprimují váhy modelu na dva nebo tři bity na parametr, čímž vymění určitou přesnost za půdorys, který se vejde přes 12GB GPU a systémovou RAM. Tento kompromis je hlavní námitka: kvantity třídy Q2 a třídy IQ2 měřitelně zhoršují kvalitu u úloh náročných na uvažování a kupující by měli považovat čísla hlavní rychlosti spíše za výchozí bod než za záruku pro každou pracovní zátěž. Srovnávací stránky komunity v úložišti sledují výsledky kvality napříč velikostmi.

Část větší vlny místní AI

Strata přichází uprostřed zrychlujícího se impulsu pro místní závěry. Rodina Qwen společnosti Alibaba se stala nejstahovanější modelovou řadou s otevřenou hmotností, Meta a Google mají vlastní konkurenční modely s otevřeným zdrojem a vlna nástrojů nyní umožňuje spotřebitelům provozovat schopné asistenty bez předplatného nebo dat opouštějících jejich zařízení.

Projekt také odráží, jak se mění definice „spotřebitelského hardwaru“. Grafická karta střední třídy 2026 s 12 GB paměti VRAM, která byla dodávána především pro hraní her, je nyní životaschopným akcelerátorem inference pro model ve velikostní třídě, která před dvěma lety definovala hraniční systémy.

Strata zůstává raným softwarem – nástroj pro sledování problémů úložiště dokumentuje hrubé hrany na starších GPU a procesorech jiných než AVX2 – ale projekt je licencován MIT, je zdarma a vyvíjen otevřeně, s experimentální podporou pro Intel Arc, starší karty Tesla a Radeon a multi-GPU soupravy zdokumentované členy komunity.

Pro vývojáře může být nejpraktičtějším řešením kompatibilita localhost API: jakýkoli skript nebo agent napsaný proti OpenAI nebo Anthropic SDK lze přesměrovat na místní nasazení Qwen změnou základní adresy URL, díky čemuž je Strata možností s nízkým třením pro prototypování citlivé na soukromí, offline použití nebo jednoduše omezení výdajů na API.

Jak to zkusit

Začínáme nevyžaduje terminálovou relaci s manuálem. Instalační program poskytuje ovladače, modelové váhy a místní server v jednom průchodu a úložiště obsahuje instalační soubor navržený pro vložení přímo do AI kódovacího asistenta, který pak autonomně nakonfiguruje stroj. První spouštění je pomalejší, zatímco se závaží načítají z disku; dokumentace doporučuje SSD a varuje, že dlouhé rozhovory přesouvají více práce na systémovou RAM.

Zůstaňte napřed před AI

Sledujte AI Buzz Wire, kde najdete nejnovější informace o modelech s otevřeným zdrojovým kódem, místních nástrojích AI a inferenčním hardwaru.

Přečtěte si další zprávy o AI →