Cerebras Systems dan OpenAI telah berbagi pandangan awal tentang Ultrafast Mode, tingkat layanan baru yang diluncurkan pertama kali di OpenAI API dan didukung oleh teknologi skala wafer Cerebras. Kemitraan ini memungkinkan GPT-5.6 Sol berjalan dengan kecepatan hingga 750 token keluaran per detik, memberikan kecerdasan tingkat terdepan dengan kecepatan waktu nyata. Untuk berita terbaru tentang perangkat keras AI, kunjungi AI Buzz Wire.
Menghilangkan Pengorbanan antara Kecepatan dan Intelijen
Para pembuat AI telah lama menghadapi tantangan mendasar: seiring dengan peningkatan ukuran dan kecerdasan model, mereka memerlukan biaya komputasi dan perpindahan data yang lebih tinggi, sehingga memperlambat waktu respons. Pengembang dipaksa untuk memilih antara menunggu hasil berkualitas tinggi atau menerima hasil yang lebih rendah dalam waktu yang lebih singkat.
GPT-5.6 Sol pada Mode Ultrafast dirancang untuk mengatasi dilema ini. Menurut Cerebras, layanan ini berjalan 11 kali lebih cepat daripada Claude Fable 5 dari Anthropic dan 5 kali lebih cepat daripada Opus 4.8 pada mode Cepat, berdasarkan kecepatan keluaran yang dilaporkan oleh Analisis Buatan.
Ujian Terakhir Kemanusiaan: Tes Kecepatan
Cerebras menguji Ultrafast melawan model pesaing pada Ujian Terakhir Kemanusiaan (HLE), sebuah tolok ukur menantang yang terdiri dari 2.500 pertanyaan yang biasanya hanya dapat dijawab oleh mereka yang memiliki gelar PhD di bidang-bidang seperti kimia, ekonomi, dan sastra.
Dalam evaluasi yang dilakukan Cerebras, GPT-5.6 Sol pada Mode Ultrafast menjawab seluruh 2.500 pertanyaan HLE dalam 11 jam 11 menit. Claude Fable 5 membutuhkan 78 jam 27 menit, lebih dari tiga hari komputasi terus menerus, untuk sampai pada kesimpulan yang sama. Dengan kata lain, Ultrafast memproses batas pengetahuan manusia dalam satu hari kerja, mencapai akurasi yang sebanding hampir tujuh kali lebih cepat.
Benchmarking dilakukan oleh Cerebras menggunakan GPT-5.6 Sol Ultrafast dengan Codex pada setting high Reasoning pada tanggal 10 Juli, dan Claude Fable 5 dengan Claude Code pada setting High Reasoning pada tanggal 13 hingga 15 Juli.
Dampak Bisnis Dunia Nyata
Pada GDP-Val, sebuah tolok ukur untuk tugas-tugas pekerjaan pengetahuan yang bernilai ekonomis, Ultrafast memberikan kecepatan end-to-end sebesar 5,6x tanpa penurunan kualitas. Hal ini menunjukkan bagaimana inferensi yang lebih cepat dapat mempercepat pekerjaan yang bernilai ekonomis tanpa mengorbankan kualitas keluaran.
Cerebras membayangkan Ultrafast sebagai alat untuk skenario yang menganggap setiap detik penting. Perusahaan yang mengoperasikan layanan web dapat menggunakan teknologi ini untuk mengatasi akar permasalahan dan mengatasi gangguan produksi dengan lebih cepat, sehingga menjaga kepercayaan pelanggan dan mencegah hilangnya pendapatan. Dalam situasi keamanan siber yang berisiko tinggi, tim keamanan dapat memanfaatkan Ultrafast untuk mendeteksi dan merespons serangan dengan cepat.
Teknologi di Balik Kecepatan
Keunggulan kinerja berasal dari arsitektur Wafer-Scale Engine Cerebras, yang dibuat khusus untuk beban kerja AI terdepan. Tantangan inti dari inferensi fast frontier adalah masalah perpindahan data: pada GPU tradisional, inferensi pada model besar terhambat oleh bandwidth memori, karena bobot model harus ditransfer berulang kali antara memori on-chip dan penyimpanan di luar chip untuk menghasilkan token yang berurutan.
Cerebras mengambil pendekatan yang berbeda secara fundamental. Setiap chip berukuran wafer mengemas SRAM 44 GB langsung pada silikonnya. Bobot model tetap berada di dalam chip, dan token mengalir tanpa gangguan melalui lapisan model yang disalurkan ke seluruh wafer. Hal ini menghilangkan pergerakan data yang tidak efisien yang memperlambat inferensi berbasis GPU dan melakukan penskalaan dengan lancar sesuai ukuran model, sehingga membuka jalan bagi keunggulan kecepatan yang berkelanjutan pada model terdepan di masa depan.
Ketersediaan dan Posisi Pasar
GPT-5.6 Sol pada Mode Ultrafast saat ini tersedia dalam pratinjau terbatas untuk sekelompok pelanggan tertentu, dengan akses yang diperluas seiring waktu seiring bertambahnya kapasitas. Cerebras menggambarkan kemitraan ini sebagai pendorong gelombang inovasi AI berikutnya dan meningkatkan pencapaian organisasi dengan AI responsif.
Kolaborasi ini merupakan tonggak penting bagi Cerebras, yang telah lama mengupayakan komputasi skala wafer sebagai alternatif dari pasar perangkat keras AI yang didominasi GPU. Dengan bermitra langsung dengan OpenAI untuk mempercepat salah satu model frontier paling mumpuni yang ada, Cerebras menegaskan bahwa arsitekturnya menawarkan keunggulan kompetitif sejati untuk beban kerja inferensi berkecepatan tinggi.
Ketika model-model terus berkembang menjadi lebih besar dan lebih cerdas, kemampuan untuk melayani model-model tersebut dengan kecepatan real-time dapat menjadi faktor kompetitif yang menentukan dalam pasar infrastruktur AI. Kemitraan Cerebras-OpenAI memberi sinyal bahwa perlombaan untuk kecepatan inferensi kini sama pentingnya dengan perlombaan untuk kecerdasan model.
Tetap Terdepan dalam AI
Untuk berita perangkat keras AI lainnya, analisis kinerja model, dan perkembangan industri, tandai AI Buzz Wire.
Baca berita AI selengkapnya →