Cerebras telah mengambil alih CS-4, sistem inferens AI skala rak yang dibina di sekeliling pemproses skala wafer WSE-3 Turbo baharunya, dengan mendakwa mesin itu menyampaikan inferens sehingga 30 kali lebih pantas daripada sistem berasaskan GPU kerana syarikat itu meletakkan dirinya sebagai alternatif kelajuan kepada empayar pusat data Nvidia.
Pelancaran, yang diumumkan pada hari Selasa dan diperincikan di seluruh halaman produk syarikat dan gelombang liputan daripada Reuters, Bloomberg dan The Register, menandakan penyegaran perkakasan Cerebras yang paling penting sejak diumumkan — dan detik penting bagi syarikat yang sahamnya bergelut sejak IPOnya. Pelabur nampaknya memberi perhatian: saham Cerebras (CBRS) melonjak pada berita itu, dan Investor's Business Daily memetik ulasan CEO bahawa pasaran inferens AI "berkembang dengan pantas."
Bagi pembaca yang menjejaki perlumbaan yang semakin pantas untuk menjadikan model AI bertindak balas dengan lebih pantas, pelancaran CS-4 merupakan salah satu kisah perkakasan yang paling penting pada suku tersebut, dan ia mendarat di tengah-tengah peralihan yang lebih luas dalam liputan industri AI yang terus membentuk semula landskap pengiraan.
Apa yang Ada di Dalam CS-4
Komponen utama ialah WSE-3 Turbo, versi ditingkatkan bagi Enjin Skala Wafer bersaiz plat makan malam Cerebras. Menurut penyelaman teknikal teknikal The Register, WSE-3T bukanlah silikon baharu — ia mengekalkan proses TSMC 5nm yang sama, kawasan cetakan 46,225 milimeter persegi, 4 trilion transistor, 900,000 teras dan 44 GB SRAM pada-wafer seperti WSE-3 berusia dua tahun.
Sebaliknya, Cerebras mencapai penggandaan prestasinya dengan menolak cip sedia ada dengan lebih keras. WSE-3T menggandakan pengiraan FP16 jarang kepada 250 petaFLOPS, menggandakan prestasi FP16 padat kepada anggaran 25 petaFLOPS, menggandakan lebar jalur memori kepada 43.2 petabait sesaat dan menggandakan lebar jalur I/O kepada 2.4 terabit sesaat. The Register menganggarkan syarikat itu kini mencatat masa silikon pada kira-kira 2.8 GHz, meningkat daripada kira-kira 1.4 GHz pada generasi sebelumnya.
Caranya, menurut Cerebras, ialah sistem penyampaian kuasa yang direka bentuk semula yang terletak hanya 0.5 milimeter dari pemproses — kira-kira 100 kali lebih dekat daripada ~50 milimeter biasa papan GPU konvensional. Kedekatan itu hampir menghapuskan kehilangan kuasa peringkat papan dan membenarkan kuasa dua kali lebih banyak untuk mencapai wafer, membolehkan frekuensi operasi yang lebih tinggi di belakang penjanaan token yang lebih pantas.
Seni Bina Rak Nexus
Di sebalik cip itu sendiri, CS-4 memperkenalkan apa yang dipanggil oleh Cerebras sebagai Senibina Platform Nexus, reka bentuk skala rak yang pertama dan jawapan terus kepada sistem rak NVL72 dan AMD Helios Nvidia. Setiap CS-4 boleh membawa sehingga tiga pemproses WSE-3T yang ditempatkan dalam "Beg galas Skala Wafer" serba lengkap — pakej 3D yang melipat wafer, penukaran kuasa, penyejukan cecair terus, I/O berkelajuan tinggi dan elektronik kawalan ke dalam satu pemasangan dengan komponen 50% lebih sedikit.
Reka bentuk modular memisahkan kuasa stabil, penyejukan dan lapisan rangkaian daripada pengiraan. Cerebras PowerRack boleh dipasang dan memenuhi syarat kemudahan sebelum sebarang pengiraan tiba, dan beg galas kemudiannya meluncur ke tempatnya — mengurangkan masa penggunaan dari hari ke jam, menurut syarikat itu.
Penggunaan kuasa adalah besar. The Register menganggarkan sekitar 46 kW setiap beg galas dan jumlah cabutan sistem sebanyak 120 hingga 140 kW — nombor yang menarik perhatian yang bagaimanapun kelihatan konservatif di sebelah sistem rak 240 hingga 250 kW AMD dan Nvidia dijangka dihantar lewat tahun ini.
Membunuh Suis
Mungkin pilihan yang paling menarik secara teknikal ialah interkoneksi. Daripada menghalakan trafik wafer-ke-wafer melalui suis — pendekatan yang diguna pakai AWS untuk pemecut Trainium3nya — Cerebras menyambungkan cipnya ke dalam topologi torus 2D di mana wafer bersebelahan bercakap terus antara satu sama lain. Reka bentuk mengurangkan kependaman wafer-ke-wafer daripada lima mikrosaat kepada hanya dua, dan Cerebras berkata mesh itu boleh menyokong model sehingga 50 trilion parameter, dengan selesa melebihi apa-apa yang wujud pada masa ini.
Keputusan kelajuan sangat mengagumkan. Pada sistem CS-4 tunggal, firma penanda aras Analisis Buatan mengukur sehingga 4,400 token sesaat bagi setiap pengguna pada gpt-oss-120b — kira-kira 12 kali ganda ~350 token sesaat daripada perkhidmatan inferens berasaskan GPU terpantas yang tersedia hari ini. Cerebras juga mendakwa sistem itu mengekalkan lebih daripada 1,000 token sesaat pada model yang melebihi 10 trilion parameter.
Strategi Perkongsian Terpisah
Terutama, Cerebras tidak lagi cuba menjalankan keseluruhan saluran paip inferens pada silikonnya sendiri. Syarikat itu telah bekerjasama dengan AWS dan AMD untuk memuatkan inferens peringkat pemprosesan segera intensif pengiraan ke atas Trainium XPU dan GPU Instinct masing-masing, meninggalkan enjin skala wafernya untuk mengendalikan fasa penyahkod sensitif kependaman di mana rizab SRAM besar mereka bersinar.
Pelancaran CS-4 juga memanjangkan kerjasama Cerebras dengan OpenAI. Yahoo Finance melaporkan pembukaan bersama perkongsian OpenAI dan AMD baharu yang bertujuan untuk mempercepatkan inferens AI — membina mod Ultrafast yang diperkenalkan syarikat pada awal Ogos, yang membawa GPT-5.6 Sol kepada pengguna sehingga 750 token sesaat.
Kaveat Di Sebalik Nombor Tajuk
Penganalisis industri menggesa berhati-hati terhadap angka pemasaran. Daftar mencatatkan bahawa tajuk utama Cerebras 250 petaFLOPS bergantung pada kesederhanaan, yang secara amnya tidak memberi manfaat kepada inferens model bahasa yang besar, dan angka lebar jalur memori puncak sebahagian besarnya bersifat teori kerana WSE-3 tidak mempunyai pengiraan untuk memenuhi SRAMnya sendiri. Penerbitan itu juga mempersoalkan mengapa Cerebras menggandakan prestasi dan bukannya meningkatkan kapasiti SRAM, yang tidak berkembang dengan ketara sejak WSE-2 dilancarkan lima tahun lalu — pilihan yang ingin tahu dalam era inferens terpencil di mana pemecut nyahkod paling banyak memanfaatkan memori.
Namun, peluang pasaran adalah nyata. Memandangkan chatbots dan ejen AI menuntut masa tindak balas yang lebih pantas, kelajuan inferens telah menjadi pembeza daya saing yang tulen, dan Cerebras kini telah menunjukkan ia boleh mengulangi teknologi skala wafer yang tidak konvensional pada irama komersial.
Penghantaran CS-4 pertama bermula pada suku ini, dengan sistem pertama dijangka dalam talian sebelum akhir September. Sama ada itu cukup untuk menjejaskan penguasaan Nvidia masih belum dapat dilihat — tetapi buat pertama kali dalam beberapa ketika, inferens AI terpantas dalam industri mempunyai alamat baharu.
Kekal Mendahului AI
Pelancaran perkakasan seperti pasaran bergerak CS-4 dan mentakrifkan semula perkara yang boleh dilakukan oleh sistem AI. Baca lebih banyak berita AI untuk mengikuti setiap perkembangan.
Terokai liputan AI terkini →