Cerebras telah menambahkan Qwen 3.8 27B ke titik akhir publik platform Cerebras Inference, di mana model bobot terbuka berjalan pada sekitar 1,500 token per detik, menurut dokumentasi katalog model perusahaan. Daftar ini menjadikan salah satu rangkaian model terbuka Alibaba yang paling banyak digunakan, tersedia dengan kecepatan yang jauh melampaui layanan yang dihosting GPU pada umumnya.
Pengumuman tersebut langsung menarik perhatian para pengembang: berita tersebut mengumpulkan lebih dari 600 poin di Hacker News dalam sehari, tingkat daya tarik yang mencerminkan betapa tingginya permintaan akan inferensi yang cepat dan murah. Untuk mendapatkan gambaran pasar inferensi yang lebih luas, meja berita AI terkini mengikuti setiap pembaruan platform utama saat diluncurkan.
Spesifikasi di Katalog
Berdasarkan dokumentasi Cerebras, Qwen 3.8 27B membawa 27 miliar parameter dan mendukung 64 ribu token konteks pada tingkat gratis dan 128 ribu pada tingkat berbayar, berjalan pada sekitar 1.500 token per detik. Ini berada di samping model GPT-OSS 120B open-weight OpenAI, yang dalam katalog yang sama mencantumkan sekitar 3.000 token per detik dengan konteks 65 ribu pada tingkat gratis dan 131 ribu pada tingkat berbayar.
Kedua model tersedia dalam tingkat uji coba gratis dan bayar sesuai penggunaan Cerebras, tergantung pada batasan tarif. Pelanggan yang membutuhkan kapasitas cadangan, throughput yang lebih tinggi, atau SLA produksi diarahkan ke penawaran Titik Akhir Khusus perusahaan, yang juga dicantumkan dalam dokumentasi sebagai rute ke rangkaian model tambahan di luar keduanya pada titik akhir publik.
Jendela konteks patut mendapat perhatian di samping angka kecepatan. Enam puluh empat ribu token pada tingkat gratis — dan 128.000 pada tingkat berbayar — cukup untuk menyimpan basis kode yang cukup besar, dokumen panjang, atau transkrip agen yang diperluas dalam memori sekaligus, yang penting untuk beban kerja yang tepat di mana decoding cepat akan membuahkan hasil. Dokumentasi Cerebras juga mencakup panduan kompatibilitas OpenAI, sehingga menurunkan biaya peralihan untuk tim yang kodenya sudah menargetkan OpenAI SDK: pada prinsipnya, mengarahkan klien yang sudah ada ke titik akhir Cerebras adalah perubahan konfigurasi, bukan penulisan ulang.
Model Tidak Dipangkas, Kompresi Transparan
Satu detail yang perlu diperhatikan dalam dokumentasi adalah pengungkapan Cerebras tentang cara menangani kompresi model. Perusahaan menyatakan bahwa semua model pada titik akhir publiknya adalah versi asli dan belum dipangkas, dan menggunakan kuantisasi selektif hanya berat selama penyimpanan untuk menjaga kualitas. Lapisan sensitif tetap berada pada presisi penuh, aktivasi, perhatian, dan cache KV tetap tidak terkuantisasi, dan dekuantisasi terjadi dengan cepat.
Cerebras juga mengungkapkan penelitiannya mengenai teknik pemangkasan seperti REAP (Router-weighted Expert Activation Pruning): varian yang dipangkas dibagikan kepada komunitas riset di Hugging Face tetapi tidak dilayani melalui API publik. Bagi pengembang yang memilih tempat untuk menjalankan model terbuka, transparansi tentang apa yang sebenarnya disajikan sangatlah eksplisit.
Mengapa Kecepatan Token Penting
Angka throughput seperti ini paling penting untuk beban kerja agen dan pengkodean. Aplikasi yang merangkai ratusan panggilan model — agen pengkodean, alur kerja otonom, asisten real-time — melipatgandakan latensi per token di setiap langkah, sehingga perbedaan antara 50 dan 1.500 token per detik digabungkan menjadi pengalaman yang berbeda secara kualitatif. Aplikasi interaktif yang mengalirkan penyelesaian yang lama mendapatkan manfaat yang paling nyata.
Pertukarannya adalah ruang lingkup. Model dengan 27 miliar parameter tidak akan menandingi sistem frontier dalam tugas-tugas yang paling sulit, dan dokumen Cerebras sendiri mengarahkan beban kerja produksi yang berat ke kapasitas khusus. Namun untuk tugas-tugas menengah yang besar di mana model terbuka berukuran menengah sudah cukup baik — peringkasan, klasifikasi, penggunaan alat, pengeditan kode — kecepatan menjadi pembeda.
Ada juga dimensi harga yang akan dipertimbangkan oleh pengembang. Model titik akhir publik dapat digunakan dalam uji coba gratis sebelum membuat komitmen apa pun, yang menjadikan pembandingan terhadap beban kerja tim pada dasarnya bebas hambatan — sebuah langkah yang disengaja yang kontras dengan kontrak perusahaan yang memerlukan percakapan penjualan sebelum token pertama disajikan. Batasan kecepatan yang terdokumentasi adalah kendala yang harus diperhatikan: akses tingkat gratis ada untuk membuktikan kecepatan, bukan untuk menjalankan lalu lintas produksi.
Peregangan yang Sibuk untuk Model Terbuka
Penambahan ini terjadi di tengah ramainya AI kelas terbuka. Laboratorium IFM yang berbasis di UEA baru saja memperkenalkan K2 Horizon, armada terhubung yang terdiri dari enam model terbuka penuh, dan Meta terus mengulangi keluarga Muse untuk pengkodean dan penggunaan agen. Sementara itu, ekosistem model terbuka di Tiongkok menjaga kecepatan pengiriman sehingga menekan siklus pelepasan di seluruh industri.
Bagi pengembang, manfaat praktisnya adalah bahwa tumpukan model terbuka semakin matang dalam dua hal sekaligus: kemampuan, karena model berukuran menengah menutup kesenjangan dengan produk andalan dalam tugas sehari-hari, dan melayani aspek ekonomi, karena penyedia inferensi khusus bersaing dalam kecepatan mentah. Qwen 3.8 27B di Cerebras adalah titik data untuk kedua tren — model terbuka generasi saat ini yang disajikan dengan kecepatan yang luar biasa setahun yang lalu, pada perangkat keras yang dibuat khusus untuk pekerjaan tersebut.
Pengembang yang mengevaluasi platform harus mengukur beban kerja mereka sendiri: kecepatan yang dipublikasikan adalah angka katalog, throughput dunia nyata bergantung pada panjang prompt, konkurensi dan konfigurasi, dan batas kecepatan tingkat gratis akan mengikat sebelum kecepatannya terikat.
Tetap Terdepan dalam AI
Setiap rilis model, pembaruan platform inferensi, dan peluncuran alat pengembang, dilacak saat terjadi — baca berita AI selengkapnya →
