Projek sumber terbuka yang kurang dikenali yang dipanggil Strata sedang berehat sebentar. Enjin berlesen MIT, yang menjalankan Qwen3.8-Flash-Next Alibaba — model campuran pakar 125 bilion parameter — pada PC permainan biasa, dipancarkan ke muka depan Berita Hacker pada 4 Oktober dengan lebih daripada 640 mata, dan repositori GitHubnya telah mengumpul lebih 11,000 bintang sejak ia dicipta pada September.
Nadanya mudah: model 125 bilion parameter yang biasanya hidup pada pelayan boleh bersembang, menulis kod, membaca imej dan memandu ejen pengekodan sepenuhnya pada kad grafik pengguna, tanpa meninggalkan mesin.
Apa Yang Strata Sebenarnya
Strata ialah enjin inferens dan pemasang satu klik untuk Windows dan Linux. Menurut dokumentasinya, keperluannya sederhana mengikut piawaian model sempadan: GPU dengan sekurang-kurangnya 12GB VRAM daripada siri RTX 20, 30, 40 atau 50 NVIDIA atau siri Radeon RX 6000, 7000 atau 9000 AMD, sekurang-kurangnya 32GB RAM sistem, dan kira-kira ruang SSD 80GB.
Enjin menghantar versi terkuantasi Qwen3.8-Flash-Next pada beberapa tahap mampatan, dari Q2_0 hingga IQ3_S, ditambah dengan varian khusus kod. Ia mendedahkan OpenAI dan API yang serasi Anthropic pada localhost, bermakna alatan yang dibina untuk ChatGPT atau Claude — termasuk ejen pengekodan seperti Claude Code, Cursor dan Codex — boleh dihalakan pada pelayan tempatan dengan perubahan yang minimum. Input imej pilihan dan sokongan berbilang GPU disertakan, malah pemasang menawarkan mod persediaan berbantukan AI yang membolehkan pembantu pengekodan mengkonfigurasi mesin daripada satu gesaan yang ditampal.
Nombor Kelajuan
Penanda aras projek yang diterbitkan, diukur pada dua desktop pengguna, adalah sebab penyebaran keluaran. Pada NVIDIA RTX 5070 dengan 12GB VRAM yang dipasangkan dengan Ryzen 5 7600 dan 64GB RAM, Strata melaporkan:
- Kuantiti Q2_0: 94 token sesaat untuk penjanaan dan 2,650 token sesaat untuk pemprosesan segera pada dokumen 32K-token
- IQ3_S: 53 token setiap generasi kedua, 1,620 token sesaat pemprosesan segera
- Varian pengekod: 55 token setiap generasi kedua
Dari segi AMD, RX 9070 XT dengan 16GB VRAM berjaya menguruskan 60 token sesaat pada Q2_0. Dokumentasi menganggarkan bahawa RTX 3090 dengan 24GB VRAM harus mencapai 100 hingga 140 token sesaat — lebih pantas daripada kebanyakan orang boleh membaca.
Sebagai perbandingan, enam bulan lalu, menjalankan walaupun model padat 70 bilion parameter secara tempatan pada kelajuan yang boleh digunakan memerlukan stesen kerja dengan ratusan gigabait memori bersatu atau helah penyahkodan spekulatif yang agresif.
Mengapa Model 125B Sesuai pada Kad Permainan
Dua keping teknologi menjadikannya mungkin. Yang pertama ialah model itu sendiri. Seperti yang dibincangkan oleh AI Buzz Wire pada keluarannya, Qwen3.8-Flash-Next ialah gabungan seni bina pakar dengan kira-kira 125 bilion jumlah parameter tetapi hanya kira-kira 6 bilion aktif bagi setiap token — jadi setiap perkataan yang dijana menyentuh sekeping kecil rangkaian, memotong pengiraan setiap token secara mendadak.
Yang kedua ialah kuantisasi. Pratetap terpantas Strata memampatkan pemberat model kepada dua atau tiga bit bagi setiap parameter, memperdagangkan beberapa ketepatan untuk jejak yang sesuai dengan GPU 12GB dan RAM sistem. Pertukaran itu ialah kaveat utama: Kuantiti kelas Q2 dan kelas IQ2 boleh diukur merendahkan kualiti pada tugasan yang berat membuat penaakulan, dan pembeli harus menganggap nombor kelajuan tajuk sebagai titik permulaan dan bukannya jaminan untuk setiap beban kerja. Halaman penanda aras komuniti dalam repositori menjejak hasil kualiti merentas saiz.
Sebahagian daripada Gelombang AI Setempat yang Lebih Besar
Strata tiba di tengah momentum yang semakin pantas untuk inferens tempatan. Keluarga Qwen Alibaba telah menjadi barisan model berat terbuka yang paling banyak dimuat turun, Meta dan Google mempunyai model kompetitif sumber terbuka mereka sendiri, dan gelombang alatan kini membolehkan pengguna menjalankan pembantu yang berkebolehan tanpa langganan atau data meninggalkan peranti mereka.
Projek ini juga mencerminkan bagaimana takrifan "perkakasan pengguna" sedang beralih. Kad grafik 2026 jarak pertengahan dengan 12GB VRAM, yang dihantar terutamanya untuk permainan, kini merupakan pemecut inferens yang berdaya maju untuk model dalam kelas saiz yang menentukan sistem sempadan hanya dua tahun lalu.
Strata kekal sebagai perisian awal — penjejak isu repositori mendokumentasikan kelebihan kasar pada GPU lama dan pemproses bukan AVX2 — tetapi projek itu berlesen MIT, percuma dan dibangunkan secara terbuka, dengan sokongan percubaan untuk Intel Arc, kad Tesla dan Radeon yang lebih lama, dan pelantar berbilang GPU yang didokumenkan oleh ahli komuniti.
Bagi pembangun, pengambilan yang paling praktikal mungkin ialah keserasian API localhost: mana-mana skrip atau ejen yang ditulis terhadap OpenAI atau SDK Anthropic boleh diubah hala ke penempatan Qwen setempat dengan menukar URL asas, menjadikan Strata pilihan geseran rendah untuk prototaip sensitif privasi, penggunaan luar talian atau hanya mengehadkan perbelanjaan API.
Cara Mencubanya
Bermula tidak memerlukan sesi terminal dengan manual. Pemasang menyediakan pemacu, berat model dan pelayan setempat dalam satu laluan, dan repositori termasuk fail persediaan yang direka untuk ditampal terus ke dalam pembantu pengekodan AI, yang kemudiannya mengkonfigurasi mesin secara autonomi. Pelancaran pertama lebih perlahan manakala pemberat dimuatkan dari cakera; dokumentasi mengesyorkan SSD dan memberi amaran bahawa perbualan yang panjang mengalihkan lebih banyak kerja ke RAM sistem.
Kekal Mendahului AIIkuti AI Buzz Wire untuk mendapatkan maklumat terkini tentang model sumber terbuka, alatan AI tempatan dan perkakasan inferens.
Baca lebih banyak berita AI →