Cerebras dan OpenAI telah memberi pandangan awal kepada dunia Mod Ultrafast, peringkat perkhidmatan baharu yang dilancarkan pertama kali dalam API OpenAI dan dikuasakan oleh perkakasan Cerebras. Menurut pengumuman Cerebras yang diterbitkan pada 13 Ogos 2026, GPT-5.6 Sol yang berjalan pada Ultrafast memberikan sehingga 750 token keluaran sesaat — tanpa menjejaskan kualiti.

Peringkat ini pada mulanya tersedia kepada kumpulan pelanggan terpilih, dengan akses berkembang dari semasa ke semasa. Pengumuman itu, yang ditulis oleh Cerebras' Joyce Er, meletakkan tawaran itu sebagai resolusi kepada pertukaran yang telah menentukan pembangunan produk AI selama bertahun-tahun: pembina terpaksa memilih antara kelajuan dan kecerdasan, kerana model yang lebih besar dan lebih pintar menanggung kos pengiraan dan pergerakan data yang lebih tinggi yang memperlahankan masa tindak balas. Pembaca yang mengikuti perlumbaan untuk mempercepatkan model sempadan boleh menjejaki perkembangan terkini di AI Buzz Wire.

Seberapa Pantas Ultrafast, Tepat?

Nombor pemprosesan mentah adalah menarik dengan sendirinya, tetapi Cerebras juga membekalkan konteks perbandingan. Menurut kelajuan output yang dilaporkan oleh Analisis Buatan, perkhidmatan penanda aras bebas, GPT-5.6 Sol pada mod Ultrafast berjalan:

  • 11x lebih pantas daripada Fable 5
  • 5x lebih pantas daripada Opus 4.8 pada mod Pantas

Untuk menguji dakwaan itu, Cerebras menjalankan model itu secara berdepan dengan pesaing popular pada Peperiksaan Terakhir Kemanusiaan (HLE), penanda aras mencabar yang terdiri daripada 2,500 soalan yang biasanya hanya boleh dijawab oleh mereka yang memegang PhD dalam bidang seperti kimia, ekonomi dan kesusasteraan.

Keputusan: GPT-5.6 Sol pada Ultrafast menjawab semua 2,500 soalan HLE dalam 11 jam dan 11 minit. Claude Fable 5 memerlukan 78 jam dan 27 minit — lebih daripada tiga hari pengiraan berterusan — untuk mencapai kesimpulan yang sama. Dalam erti kata lain, Ultrafast bekerja melalui sempadan pengetahuan manusia dalam satu hari bekerja, mencapai ketepatan setanding hampir 7x lebih pantas.

Cerebras mencatatkan metodologi penandaarasannya: GPT-5.6 Sol Ultrafast telah diuji dengan Codex pada xhigh reasoning pada 10 Julai, manakala Claude Fable 5 diuji dengan Claude Code pada xhigh reasoning 13–15 Julai.

Beban Kerja Dunia Sebenar, Bukan Sekadar Penanda Aras

Penanda aras kelajuan boleh mengelirukan jika kualiti merosot sepanjang perjalanan, itulah sebabnya Cerebras turut menyerlahkan hasil pada GDP-Val, penanda aras untuk tugas kerja pengetahuan yang bernilai ekonomi. Pada GDP-Val, Ultrafast menyampaikan 5.6x kelajuan hujung ke hujung tanpa penurunan kualiti, menurut ujian Cerebras dijalankan pada 31 Julai 2026 menggunakan GPT-5.6 Sol dan GPT-5.6 Sol Ultrafast pada penaakulan sederhana dalam Codex.

Syarikat itu berkata GPT-5.6 Sol ialah model terbaik OpenAI lagi untuk taklimat undang-undang, model kewangan dan laporan kejuruteraan — domain di mana kualiti output dan masa pemulihan kedua-duanya membawa akibat kewangan langsung.

Mengapa Kelajuan Mengubah Persamaan Ejen

Peralihan yang lebih berbangkit mungkin dalam cara ejen AI beroperasi. Inferens yang lebih cepat mengubah apa yang mungkin untuk individu dan organisasi, kerana ejen boleh diletakkan di laluan kritikal masalah di mana setiap detik penting.

"Dengan GPT-5.6 Sol Ultrafast, Cerebras mendayakan AI yang mengikuti cara anda berfikir, mengekod dan bekerjasama," kata Rohan Varma, Produk di OpenAI, dalam satu kenyataan yang dipetik dalam pengumuman itu. "Kami teruja untuk melihat bagaimana aliran kerja dan aplikasi diubah oleh inferens Ultrafast."

Cerebras menggariskan beberapa senario berkepentingan tinggi di mana kelajuan itu penting:

Sambutan insiden

Syarikat yang mengendalikan perkhidmatan web boleh menggunakan Ultrafast untuk punca dan menangani gangguan pengeluaran, memelihara kepercayaan pelanggan, mencegah kehilangan hasil dan menjimatkan minit masa henti berbanding SLA mereka.

Keselamatan siber

Dalam serangan siber yang bermusuhan dan berkepentingan tinggi, pasukan keselamatan mesti cepat mengesan dan bertindak balas kepada pelakon jahat untuk membendung kerugian besar — satu tugas di mana kependaman inferens secara langsung mempengaruhi kawalan kerosakan.

Produktiviti ejen

Ultrafast mendayakan mod baharu bekerja dengan ejen dengan menyampaikan cerapan dan kemas kini masa nyata, mengurangkan keperluan untuk menukar konteks merentas sesi selari.

"Walaupun dahulu saya mungkin perlu menunggu beberapa minit untuk menyelesaikan tugasan, ia kini selesai untuk saya sebelum saya mempunyai peluang untuk menukar konteks. Ia menjadikan saya lebih produktif," kata Jeffrey Wang, penyelidik di OpenAI, dalam pengumuman itu.

Strategi Di Sebalik Perkongsian

Bagi Cerebras, perjanjian itu mewakili satu lagi kejayaan dalam usahanya untuk mengkomersialkan pecutan skala wafer untuk inferens AI. Untuk OpenAI, Mod Ultrafast menambah peringkat kelajuan premium pada APInya pada saat kependaman inferens telah menjadi pembeza yang kompetitif — terutamanya untuk aplikasi agen yang merangkai banyak panggilan model bersama-sama, di mana setiap panggilan melambatkan kompaun menjadi beberapa minit menunggu.

Syarikat itu merangka peringkat sebagai kelebihan yang berterusan untuk organisasi yang menggunakan AI sempadan untuk bertindak balas dengan cepat kepada maklumat yang masuk, menggandingkan pemprosesan Ultrafast untuk kerja sensitif masa dengan pemprosesan standard untuk tugasan komoditi yang boleh disejajarkan di latar belakang.

Akses dilancarkan secara beransur-ansur. Pembangun yang berminat boleh memantau dokumentasi OpenAI API untuk ketersediaan, kerana Cerebras berkata akses akan berkembang dari semasa ke semasa daripada kumpulan pelanggan pilihan awal.

Kekal Mendahului AI

Untuk liputan lanjut tentang perlumbaan perkakasan dan infrastruktur yang membentuk semula kecerdasan buatan, tandai halaman AI Buzz Wire dan ikuti suapan berita perkakasan AI.

Baca lebih banyak berita AI →