Sebuah proyek sumber terbuka yang kurang dikenal bernama Strata sedang mengalami momen. Mesin berlisensi MIT, yang menjalankan Qwen3.8-Flash-Next milik Alibaba — model campuran ahli dengan 125 miliar parameter — pada PC gaming biasa, muncul di halaman depan Hacker News pada tanggal 4 Oktober dengan lebih dari 640 poin, dan repositori GitHub-nya telah mengumpulkan lebih dari 11.000 bintang sejak dibuat pada tanggal 24 September.
Sarannya sederhana: model dengan 125 miliar parameter yang biasanya ada di server dapat mengobrol, menulis kode, membaca gambar, dan menggerakkan agen pengkodean sepenuhnya pada kartu grafis konsumen, tanpa meninggalkan apa pun di mesin.
Apa yang Sebenarnya Dilakukan Strata
Strata adalah mesin inferensi dan penginstal sekali klik untuk Windows dan Linux. Menurut dokumentasinya, persyaratannya sederhana menurut standar model frontier: GPU dengan setidaknya 12 GB VRAM dari seri NVIDIA RTX 20, 30, 40, atau 50 atau seri AMD Radeon RX 6000, 7000, atau 9000, setidaknya 32 GB sistem RAM, dan sekitar 80 GB ruang SSD kosong.
Mesin mengirimkan versi terkuantisasi Qwen3.8-Flash-Next pada beberapa tingkat kompresi, dari Q2_0 hingga IQ3_S, ditambah varian khusus kode. Ini memperlihatkan OpenAI dan API yang kompatibel dengan Anthropic di localhost, artinya alat yang dibuat untuk ChatGPT atau Claude — termasuk agen pengkodean seperti Claude Code, Cursor, dan Codex — dapat diarahkan ke server lokal dengan sedikit perubahan. Input gambar opsional dan dukungan multi-GPU disertakan, dan penginstal bahkan menawarkan mode pengaturan berbantuan AI yang memungkinkan asisten pengkodean mengonfigurasi mesin dari satu perintah yang ditempelkan.
Angka Kecepatan
Tolok ukur proyek yang dipublikasikan, diukur pada dua desktop konsumen, adalah alasan penyebaran rilis tersebut. Pada NVIDIA RTX 5070 dengan VRAM 12 GB yang dipasangkan dengan Ryzen 5 7600 dan RAM 64 GB, Strata melaporkan:
- Kuantisasi Q2_0: 94 token per detik untuk pembuatan dan 2.650 token per detik untuk pemrosesan cepat pada dokumen 32 ribu token
- IQ3_S: 53 token per generasi kedua, 1.620 token per detik pemrosesan cepat
- Varian pembuat kode: 55 token per generasi kedua
Di sisi AMD, RX 9070 XT dengan VRAM 16 GB mengelola 60 token per detik pada Q2_0. Dokumentasi memperkirakan bahwa RTX 3090 dengan VRAM 24 GB akan mencapai 100 hingga 140 token per detik — lebih cepat daripada yang dapat dibaca kebanyakan orang.
Sebagai perbandingan, enam bulan lalu, menjalankan model padat 70 miliar parameter secara lokal dengan kecepatan yang dapat digunakan memerlukan stasiun kerja dengan memori terpadu ratusan gigabyte atau trik decoding spekulatif yang agresif.
Mengapa Model 125B Cocok di Kartu Gaming
Dua teknologi memungkinkan hal ini. Yang pertama adalah model itu sendiri. Seperti yang dijelaskan oleh AI Buzz Wire pada peluncurannya, Qwen3.8-Flash-Next adalah arsitektur campuran pakar dengan total sekitar 125 miliar parameter tetapi hanya sekitar 6 miliar yang aktif per token — sehingga setiap kata yang dihasilkan menyentuh sebagian kecil jaringan, sehingga memotong komputasi per token secara drastis.
Yang kedua adalah kuantisasi. Preset tercepat Strata memampatkan bobot model menjadi dua atau tiga bit per parameter, memberikan akurasi tertentu untuk ukuran yang sesuai dengan GPU 12 GB dan RAM sistem. Pengorbanan tersebut adalah peringatan utama: quants kelas Q2 dan kelas IQ2 secara signifikan menurunkan kualitas pada tugas-tugas yang berat, dan pembeli harus memperlakukan angka kecepatan utama sebagai titik awal dan bukan jaminan untuk setiap beban kerja. Halaman tolok ukur komunitas di repositori melacak hasil kualitas di berbagai ukuran.
Bagian dari Gelombang AI Lokal yang Lebih Besar
Strata hadir di tengah percepatan momentum inferensi lokal. Keluarga Qwen dari Alibaba telah menjadi lini model open-weight yang paling banyak diunduh, Meta dan Google memiliki model kompetitif bersumber terbuka, dan serangkaian alat kini memungkinkan konsumen menjalankan asisten yang mumpuni tanpa perlu berlangganan atau data meninggalkan perangkat mereka.
Proyek ini juga mencerminkan bagaimana definisi "perangkat keras konsumen" mengalami pergeseran. Kartu grafis kelas menengah tahun 2026 dengan VRAM 12 GB, yang dikirimkan terutama untuk bermain game, kini menjadi akselerator inferensi yang layak untuk model di kelas ukuran yang mendefinisikan sistem frontier dua tahun lalu.
Strata masih merupakan perangkat lunak awal — pelacak masalah repositori mendokumentasikan sisi buruk pada GPU lama dan prosesor non-AVX2 — namun proyek ini berlisensi MIT, gratis, dan dikembangkan secara terbuka, dengan dukungan eksperimental untuk Intel Arc, kartu Tesla dan Radeon lama, dan rig multi-GPU yang didokumentasikan oleh anggota komunitas.
Bagi pengembang, hal yang paling praktis mungkin adalah kompatibilitas API localhost: skrip atau agen apa pun yang ditulis dengan OpenAI atau Anthropic SDK dapat dialihkan ke penerapan Qwen lokal dengan mengubah URL dasar, menjadikan Strata opsi yang mudah untuk pembuatan prototipe yang sensitif terhadap privasi, penggunaan offline, atau sekadar membatasi pengeluaran API.
Cara Mencobanya
Memulai tidak memerlukan sesi terminal dengan manual. Penginstal menyediakan driver, bobot model, dan server lokal dalam satu jalur, dan repositori menyertakan file pengaturan yang dirancang untuk ditempelkan langsung ke asisten pengkodean AI, yang kemudian mengonfigurasi mesin secara mandiri. Peluncuran pertama lebih lambat saat bobot dimuat dari disk; dokumentasi merekomendasikan SSD dan memperingatkan bahwa percakapan panjang mengalihkan lebih banyak pekerjaan ke RAM sistem.
Tetap Terdepan dalam AIIkuti AI Buzz Wire untuk mengetahui informasi terbaru tentang model sumber terbuka, alat AI lokal, dan perangkat keras inferensi.
Baca berita AI selengkapnya →