Un proiect open-source puțin cunoscut numit Strata are un moment. Motorul licențiat de MIT, care rulează Qwen3.8-Flash-Next de la Alibaba — un model de 125 de miliarde de parametri cu amestec de experți — pe computere de jocuri obișnuite, a apărut pe prima pagină a Hacker News pe 4 octombrie cu peste 640 de puncte, iar depozitul său GitHub a strâns peste 12400 de stele de când a fost creat pe 11 septembrie.

Prezentul este simplu: un model de 125 de miliarde de parametri care trăiește în mod normal pe un server poate să converseze, să scrie cod, să citească imagini și să conducă agenții de codificare în întregime pe o placă grafică de consum, fără să părăsească aparatul.

Ce face de fapt Strata

Strata este atât un motor de inferență, cât și un program de instalare cu un singur clic pentru Windows și Linux. Conform documentației sale, cerințele sunt modeste pentru standardele modelului de frontieră: un GPU cu cel puțin 12 GB de VRAM din seria NVIDIA RTX 20, 30, 40 sau 50 sau seria AMD Radeon RX 6000, 7000 sau 9000, cel puțin 32 GB de RAM de sistem și aproximativ 80 GB de spațiu liber SSD.

Motorul livrează versiuni cuantificate ale Qwen3.8-Flash-Next la mai multe niveluri de compresie, de la Q2_0 până la IQ3_S, plus o variantă specializată în cod. Expune API-urile compatibile cu OpenAI și Anthropic pe localhost, ceea ce înseamnă că instrumentele create pentru ChatGPT sau Claude - inclusiv agenți de codare precum Claude Code, Cursor și Codex - pot fi direcționate către serverul local cu modificări minime. Intrarea opțională a imaginii și suportul multi-GPU sunt incluse, iar programul de instalare oferă chiar și un mod de configurare asistat de AI care permite unui asistent de codare să configureze aparatul dintr-o singură solicitare lipită.

Numerele vitezei

Valorile de referință publicate ale proiectului, măsurate pe două desktop-uri pentru consumatori, sunt motivul pentru care s-a răspândit lansarea. Pe un NVIDIA RTX 5070 cu 12 GB de VRAM asociat cu un Ryzen 5 7600 și 64 GB de RAM, Strata raportează:

  • Cuantificare Q2_0: 94 de jetoane pe secundă pentru generare și 2.650 jetoane pe secundă pentru procesare promptă pe un document de 32.000 de jetoane
  • IQ3_S: 53 de jetoane pe secundă de generație, 1.620 de jetoane pe secundă procesare promptă
  • Varianta codificatorului: 55 de jetoane pe secundă generație

Pe partea AMD, un RX 9070 XT cu 16 GB de VRAM a gestionat 60 de jetoane pe secundă la Q2_0. Documentația estimează că un RTX 3090 cu 24 GB de VRAM ar trebui să ajungă la 100 până la 140 de jetoane pe secundă - mai repede decât pot citi majoritatea oamenilor.

Pentru comparație, în urmă cu șase luni, rularea locală chiar și a unui model dens de 70 de miliarde de parametri la viteze utilizabile a necesitat o stație de lucru cu sute de gigaocteți de memorie unificată sau trucuri de decodare speculative agresive.

De ce se potrivește un model 125B pe o cartelă de joc

Două piese de tehnologie fac acest lucru posibil. Primul este modelul în sine. Așa cum a descris AI Buzz Wire la lansarea sa, Qwen3.8-Flash-Next este o arhitectură combinată de experți, cu aproximativ 125 de miliarde de parametri în total, dar doar aproximativ 6 miliarde activi per token - astfel încât fiecare cuvânt generat atinge o mică parte a rețelei, reducând dramatic calculul pe token.

A doua este cuantizarea. Cele mai rapide presetări ale Strata comprimă greutățile modelului la doi sau trei biți pe parametru, schimbând o anumită precizie pentru o amprentă care se potrivește pe un GPU de 12 GB și pe un sistem RAM. Acest compromis este principalul avertisment: cuantiștile de clasă Q2 și IQ2 degradează în mod măsurabil calitatea în sarcini grele de raționament, iar cumpărătorii ar trebui să trateze numerele de viteză din titlu ca un punct de plecare mai degrabă decât o garanție pentru fiecare volum de lucru. Paginile de referință ale comunității din depozit urmăresc rezultatele calității pe dimensiuni.

Parte a unui val mai mare de IA locală

Strata sosește pe fondul unui impuls accelerat pentru inferența locală. Familia Qwen de la Alibaba a devenit cea mai descărcată linie de modele deschise, Meta și Google au propriile modele competitive cu sursă deschisă, iar un val de instrumente le permite acum consumatorilor să ruleze asistenți capabili fără abonamente sau date să le părăsească dispozitivele.

Proiectul reflectă, de asemenea, modul în care se schimbă definiția „hardware de consum”. O placă grafică mid-range 2026 cu 12 GB de VRAM, care a fost livrată în principal pentru jocuri, este acum un accelerator de inferență viabil pentru un model din clasa de mărime care a definit sistemele de frontieră în urmă cu doar doi ani.

Strata rămâne software-ul timpuriu - trackerul de probleme al depozitului documentează marginile aspre pe GPU-urile mai vechi și pe procesoarele non-AVX2 - dar proiectul este licențiat de MIT, gratuit și dezvoltat în mod deschis, cu suport experimental pentru Intel Arc, plăci mai vechi Tesla și Radeon și platforme multi-GPU documentate de membrii comunității.

Pentru dezvoltatori, cea mai practică concluzie poate fi compatibilitatea localhost API: orice script sau agent scris pe OpenAI sau Anthropic SDK poate fi redirecționat către o implementare locală Qwen prin schimbarea unei adrese URL de bază, făcând Strata o opțiune cu frecare redusă pentru prototipuri sensibile la confidențialitate, utilizare offline sau pur și simplu limitarea cheltuielilor API.

Cum să-l încerci

Pentru început nu necesită o sesiune de terminal cu un manual. Programul de instalare furnizează driverele, greutățile modelului și serverul local într-o singură trecere, iar depozitul include un fișier de configurare conceput pentru a fi lipit direct într-un asistent de codare AI, care apoi configurează mașina în mod autonom. Primele lansări sunt mai lente în timp ce greutățile se încarcă de pe disc; documentația recomandă un SSD și avertizează că conversațiile lungi transferă mai multă muncă pe RAM de sistem.

Rămâneți înaintea AI

Urmăriți AI Buzz Wire pentru cele mai recente modele open-source, instrumente AI locale și hardware de inferență.

Citiți mai multe știri AI →