Sistem Cerebras dan OpenAI telah berkongsi pandangan awal tentang Mod Ultrafast, peringkat perkhidmatan baharu yang dilancarkan pertama kali dalam OpenAI API dan dikuasakan oleh teknologi skala wafer Cerebras. Perkongsian itu membolehkan GPT-5.6 Sol berjalan pada sehingga 750 token keluaran sesaat, memberikan kecerdasan peringkat sempadan pada kelajuan masa nyata. Untuk berita perkakasan AI terkini, lawati AI Buzz Wire.
Menghapuskan Tradeoff Kepantasan-Kepintaran
Pembina AI telah lama menghadapi pertukaran asas: apabila model meningkat dalam saiz dan kecerdasan, mereka menanggung kos pengiraan dan pergerakan data yang lebih tinggi, memperlahankan masa tindak balas. Pembangun terpaksa memilih antara menunggu hasil yang berkualiti tinggi atau menerima hasil yang lebih rendah dalam masa yang singkat.
GPT-5.6 Sol pada Mod Ultrafast direka untuk menyelesaikan dilema ini. Menurut Cerebras, perkhidmatan itu berjalan 11 kali lebih pantas daripada Claude Fable 5 Anthropic dan 5 kali lebih pantas daripada Opus 4.8 pada mod Pantas, berdasarkan kelajuan output yang dilaporkan oleh Analisis Buatan.
Peperiksaan Terakhir Kemanusiaan: Ujian Kepantasan
Cerebras menguji Ultrafast terhadap model pesaing pada Peperiksaan Terakhir Kemanusiaan (HLE), penanda aras mencabar yang terdiri daripada 2,500 soalan yang biasanya hanya boleh dijawab oleh mereka yang memegang PhD dalam bidang seperti kimia, ekonomi dan kesusasteraan.
Dalam penilaian yang dijalankan oleh Cerebras, GPT-5.6 Sol pada Mod Ultrafast menjawab semua 2,500 soalan HLE dalam masa 11 jam dan 11 minit. Claude Fable 5 memerlukan 78 jam dan 27 minit, lebih daripada tiga hari pengiraan berterusan, untuk mencapai kesimpulan yang sama. Dalam erti kata lain, Ultrafast memproses sempadan pengetahuan manusia dalam satu hari bekerja, mencapai ketepatan setanding hampir tujuh kali lebih pantas.
Penandaarasan dilakukan oleh Cerebras menggunakan GPT-5.6 Sol Ultrafast dengan Codex pada tetapan penaakulan tinggi pada 10 Julai, dan Claude Fable 5 dengan Claude Code pada tetapan penaakulan tinggi dari 13 hingga 15 Julai.
Kesan Perniagaan Dunia Sebenar
Mengenai GDP-Val, penanda aras untuk tugas kerja pengetahuan yang bernilai ekonomi, Ultrafast menyampaikan kelajuan hujung ke hujung 5.6x tanpa penurunan kualiti. Ini menunjukkan betapa inferens yang lebih pantas boleh mempercepatkan kerja yang bernilai ekonomi tanpa mengorbankan kualiti output.
Cerebras membayangkan Ultrafast sebagai alat untuk senario di mana setiap detik penting. Syarikat yang mengendalikan perkhidmatan web boleh menggunakan teknologi untuk punca dan menangani gangguan pengeluaran dengan lebih cepat, memelihara kepercayaan pelanggan dan mencegah kehilangan hasil. Dalam situasi keselamatan siber berisiko tinggi, pasukan keselamatan boleh memanfaatkan Ultrafast untuk mengesan dan bertindak balas terhadap serangan dengan pantas.
Teknologi di Sebalik Kepantasan
Kelebihan prestasi berpunca daripada seni bina Enjin Skala Wafer Cerebras, yang direka khas untuk beban kerja AI sempadan. Cabaran teras inferens sempadan pantas ialah masalah pergerakan data: pada GPU tradisional, inferens pada model besar disekat oleh lebar jalur memori, kerana berat model mesti berulang kali dipindahkan antara memori pada cip dan storan luar cip untuk menjana token berturut-turut.
Cerebras mengambil pendekatan yang berbeza secara asasnya. Setiap cip bersaiz wafer membungkus 44 GB SRAM terus pada silikon. Berat model kekal pada cip dan token mengalir tanpa gangguan melalui lapisan model yang disalurkan merentasi wafer. Ini menghapuskan pergerakan data yang tidak cekap yang memperlahankan inferens berasaskan GPU dan menskala dengan lancar dengan saiz model, membuka jalan untuk kelebihan kelajuan yang berterusan pada model sempadan masa hadapan.
Ketersediaan dan Kedudukan Pasaran
GPT-5.6 Sol pada Mod Ultrafast kini tersedia dalam pratonton terhad kepada kumpulan pelanggan terpilih, dengan akses berkembang dari semasa ke semasa apabila kapasiti bertambah. Cerebras menggambarkan perkongsian itu sebagai memperkasa gelombang inovasi AI seterusnya dan meningkatkan siling untuk perkara yang boleh dicapai oleh organisasi dengan AI responsif.
Kerjasama itu mewakili pencapaian penting untuk Cerebras, yang telah lama mengejar pengkomputeran skala wafer sebagai alternatif kepada pasaran perkakasan AI yang dikuasai GPU. Dengan bekerjasama secara langsung dengan OpenAI untuk mempercepatkan salah satu model sempadan paling berkebolehan yang tersedia, Cerebras membuat kes yang kukuh bahawa seni binanya menawarkan kelebihan daya saing yang tulen untuk beban kerja inferens berkelajuan tinggi.
Memandangkan model terus berkembang lebih besar dan lebih pintar, keupayaan untuk melayani mereka pada kelajuan masa nyata boleh menjadi faktor daya saing yang menentukan dalam pasaran infrastruktur AI. Perkongsian Cerebras-OpenAI memberi isyarat bahawa perlumbaan untuk kelajuan inferens kini sama pentingnya dengan perlumbaan untuk kecerdasan model.
Kekal Mendahului AI
Untuk lebih banyak berita perkakasan AI, analisis prestasi model dan perkembangan industri, tandai halaman AI Buzz Wire.
Baca lebih banyak berita AI →