Proyèk open-source sing kurang dikenal sing diarani Strata lagi wae. Mesin sing dilisensi MIT, sing nganggo Qwen3.8-Flash-Next Alibaba - model campuran-para-parameter 125 milyar - ing PC game biasa, dijupuk menyang kaca ngarep Hacker News tanggal 4 Oktober kanthi luwih saka 640 poin, lan repositori GitHub wis diklumpukake luwih saka 11,000 bintang wiwit digawe tanggal 14 September.

Jarak kasebut prasaja: model parameter 125 milyar sing biasane manggon ing server bisa ngobrol, nulis kode, maca gambar lan nyopir agen coding kabeh ing kertu grafis konsumen, tanpa ana sing ninggalake mesin.

Apa Strata Sejatine

Strata minangka mesin inferensi lan installer siji-klik kanggo Windows lan Linux. Miturut dokumentasi kasebut, syarat kasebut sithik miturut standar model perbatasan: GPU kanthi paling ora 12GB VRAM saka NVIDIA RTX 20, 30, 40 utawa 50 seri utawa AMD's Radeon RX 6000, 7000 utawa 9000 seri, paling ora 32GB RAM sistem, lan kira-kira ruang SSD 80GB.

Mesin kasebut ngirimake versi Qwen3.8-Flash-Next ing sawetara tingkat kompresi, saka Q2_0 nganti IQ3_S, ditambah karo varian khusus kode. Iki mbukak OpenAI lan API sing kompatibel karo Anthropic ing localhost, tegese alat sing dibangun kanggo ChatGPT utawa Claude - kalebu agen coding kaya Claude Code, Cursor lan Codex - bisa ditunjuk ing server lokal kanthi owah-owahan minimal. Input gambar opsional lan dhukungan multi-GPU kalebu, lan installer malah nawakake mode persiyapan sing dibantu AI sing ngidini asisten coding ngatur mesin saka pituduh sing ditempelake.

Angka Kacepetan

Tolok ukur sing diterbitake proyek kasebut, diukur ing rong desktop konsumen, minangka sebab nyebarake rilis. Ing NVIDIA RTX 5070 kanthi 12GB VRAM dipasangake karo Ryzen 5 7600 lan 64GB RAM, Strata laporan:

  • Q2_0 kuantisasi: 94 token per detik kanggo generasi lan 2,650 token per detik kanggo proses cepet ing dokumen 32K-token
  • IQ3_S: 53 token saben generasi detik, 1.620 token per detik pangolahan cepet
  • Coder varian: 55 token saben generasi kapindho

Ing sisih AMD, RX 9070 XT kanthi 16GB VRAM ngatur 60 token per detik ing Q2_0. Dokumentasi ngira yen RTX 3090 kanthi 24GB VRAM kudu tekan 100 nganti 140 token per detik - luwih cepet tinimbang sing bisa diwaca wong akeh.

Kanggo mbandhingake, nem sasi kepungkur, malah model kandhel 70 milyar parameter lokal kanthi kecepatan sing bisa digunakake mbutuhake stasiun kerja kanthi atusan gigabyte memori terpadu utawa trik dekoding spekulatif sing agresif.

Kenapa Model 125B Cocog ing Kartu Game

Rong potongan teknologi nggawe iki bisa ditindakake. Kaping pisanan yaiku model dhewe. Nalika AI Buzz Wire diliput nalika dirilis, Qwen3.8-Flash-Next minangka arsitektur campuran pakar kanthi total 125 milyar paramèter nanging mung udakara 6 milyar aktif saben token - saéngga saben tembung sing diasilake ndemek irisan cilik jaringan, kanthi dramatis ngetung saben token.

Kapindho yaiku kuantisasi. Prasetel paling cepet Strata ngompres bobot model dadi loro utawa telung bit saben parameter, dagang sawetara akurasi kanggo jejak sing cocog karo GPU 12GB lan RAM sistem. Tradeoff kasebut minangka caveat utama: kelas Q2 lan kelas IQ2 jumlahe bisa nyuda kualitas ing tugas-tugas abot, lan para panuku kudu nganggep nomer kacepetan judhul minangka titik wiwitan tinimbang jaminan kanggo saben beban kerja. Kaca-kaca pathokan komunitas ing repositori nglacak asil kualitas ing kabeh ukuran.

Bagéyan saka Gelombang AI Lokal sing luwih gedhé

Strata teka ing tengah-tengah momentum nyepetake kanggo inferensi lokal. Kulawarga Qwen Alibaba wis dadi garis model bobot mbukak sing paling akeh diunduh, Meta lan Google duwe model kompetitif sumber terbuka dhewe, lan gelombang alat saiki ngidini para konsumen mbukak asisten sing mumpuni tanpa langganan utawa data ninggalake piranti.

Proyek kasebut uga nggambarake kepiye definisi "hardware konsumen" ganti. Kertu grafis mid-range 2026 kanthi 12GB VRAM, sing dikirim utamane kanggo game, saiki dadi akselerator inferensi sing sregep kanggo model ing kelas ukuran sing nemtokake sistem perbatasan mung rong taun kepungkur.

Strata tetep lunak awal - masalah repositori tracker dokumen pinggiran kasar ing GPUs lawas lan prosesor non-AVX2 - nanging project MIT-lisensi, free, lan dikembangaké ing mbukak, karo support eksperimen kanggo Intel Arc, Tesla lawas lan kertu Radeon, lan multi-GPU rigs didokumentasikan dening anggota masyarakat.

Kanggo pangembang, sing paling praktis yaiku kompatibilitas API localhost: skrip utawa agen apa wae sing ditulis nglawan OpenAI utawa Anthropic SDK bisa dialihake menyang penyebaran Qwen lokal kanthi ngganti URL dhasar, nggawe Strata minangka pilihan sing kurang gesekan kanggo prototipe sing sensitif privasi, panggunaan offline, utawa mung nutup biaya API.

Carane Coba Iku

Miwiti ora mbutuhake sesi terminal kanthi manual. Pemasang nyedhiyakake driver, bobot model lan server lokal ing siji pass, lan repositori kalebu file persiyapan sing dirancang kanggo ditempelake langsung menyang asisten kodhe AI, sing banjur ngatur mesin kanthi otomatis. Bukak pisanan luwih alon nalika bobot mbukak saka disk; dokumentasi Rekomendasi SSD lan warns sing obrolan dawa shift liyane karya menyang sistem RAM.

Tetep ing ngarep AI

Tindakake AI Buzz Wire kanggo paling anyar babagan model open-source, alat AI lokal, lan hardware inferensi.

Waca liyane warta AI →