AMD dan Cerebras Systems telah melancarkan perkongsian teknikal untuk membina infrastruktur inferens AI jenis baharu, menggabungkan platform Helios skala rak AMD dengan Enjin Skala Wafer (WSE) Cerebras dalam satu aliran kerja terpisah. Diumumkan pada acara Advancing AI 2026 AMD pada 23 Julai 2026, kerjasama itu menyasarkan secara langsung kepada kesesakan kependaman dan daya pemprosesan yang telah menjadikan inferens sebagai salah satu masalah paling mahal dalam era AI generatif. Untuk maklumat terkini mengenai sudut industri yang bergerak pantas ini, ikuti liputan berita terbaharu AI kami.
Idea teras adalah untuk berhenti memaksa satu cip untuk melakukan segala-galanya. Dalam tindanan inferens tradisional, satu keluarga GPU mengendalikan kedua-dua kerja praisi berat untuk mencerna kerja yang pantas dan halus serta berurutan untuk menjana setiap token baharu. Itu adalah kompromi, kerana kedua-dua pekerjaan mempunyai tuntutan yang sangat berbeza. AMD dan Cerebras berpendapat bahawa pembahagian kerja, teknik yang dikenali sebagai inferens terpisah, membolehkan setiap enjin melakukan yang terbaik.
Bagaimana kedua-dua enjin membahagikan tenaga kerja
Menurut pengumuman rasmi AMD, AMD Helios akan berfungsi sebagai enjin pemprosesan berprestasi tinggi, berskala, menggunakan GPU AMD Instinct untuk memproses kumpulan input yang besar dengan pantas. Sementara itu, Enjin Skala Wafer Cerebras akan mengendalikan penyahkod dan penjanaan token ultra-pantas, ultra-pendaman ultra rendah. Cip Cerebras dibina pada keseluruhan wafer dan bukannya dipotong dadu menjadi dadu individu, memberikan mereka lebar jalur memori pada cip yang sangat besar yang amat sesuai untuk menstrim keluar token tanpa terhenti.
Syarikat-syarikat itu mengatakan bahawa dengan menggabungkan dua enjin pengiraan, penyelesaian bersama itu dijangka menyampaikan sehingga 5x lebih tinggi token sesaat setiap watt, metrik yang telah menjadi kad skor pusat untuk ekonomi inferens kerana penyedia bersaing dalam kedua-dua kos kelajuan dan tenaga. Angka itu dipetik dalam siaran akhbar AMD dan dilaporkan di seluruh cawangan termasuk Perkakasan Tom, Investing.com dan Yahoo Tech.
Satu pukulan pada penguasaan Nvidia
Perkongsian itu juga merupakan isyarat strategik. Ekosistem CUDA Nvidia dan barisan GPU kini mendominasi latihan dan inferens AI, dan pencabar semakin membuat kesimpulan bahawa mengalahkan penyandang secara langsung pada satu seni bina adalah sukar. Business Insider merangka perjanjian itu ketika AMD mengambil kesempatan di Nvidia dengan mempertaruhkan inferens, fasa pengkomputeran AI dijangka berkembang paling pantas apabila model beralih daripada pembangunan kepada pengeluaran.
Untuk AMD, berpasangan dengan Cerebras meluaskan daya tarikan peta jalan Instinct dan Heliosnya melangkaui latihan. Bagi Cerebras, yang berdagang di Nasdaq di bawah penanda CBRS bersama AMD (NASDAQ: AMD), penyepaduan dengan vendor pemecut utama memberikan teknologi berskala wafernya laluan yang lebih jelas ke dalam penggunaan perusahaan dan awan yang besar. Cerebras merancang untuk menggunakan AMD Helios di pusat datanya sendiri, dan syarikat menjangkakan penyelesaian bersama itu akan tersedia terlebih dahulu melalui Cerebras Cloud pada separuh kedua 2026.
Mengapa pengasingan penting sekarang
Kos inferens telah menjadi titik tekanan yang menentukan untuk industri AI. Apabila model semakin besar dan aplikasi menuntut respons masa nyata, perbelanjaan untuk menghasilkan setiap token, dan pengalaman pengguna kependaman menunggunya, boleh menentukan sama ada sesuatu produk itu berdaya maju. Inferens diasingkan menganggap praisi dan nyahkod sebagai beban kerja berasingan yang boleh dialihkan ke perkakasan yang paling sepadan dengan setiap satu, falsafah reka bentuk yang telah diperjuangkan oleh syarikat seperti Cerebras selama lebih setahun.
Pengumuman AMD-Cerebras mencadangkan pendekatan itu beralih daripada idea pemberontak kepada seni bina yang disokong oleh industri. Dengan menggandingkan pakar pemprosesan dengan pakar kependaman, kedua-dua syarikat bertaruh bahawa masa depan inferens bukanlah satu cip untuk mengawal semuanya, tetapi sistem penyelarasan enjin khusus.
Apa yang perlu ditonton
Beberapa soalan kekal. Angka token-per-saat-per-watt 5x adalah jangkaan dan bukannya penanda aras pihak ketiga, dan prestasi dunia sebenar akan bergantung pada model dan beban kerja tertentu yang dijalankan oleh pelanggan. Butiran harga dan ketersediaan di luar pelancaran Cerebras Cloud belum didedahkan, dan tidak jelas bila penyelesaian itu mungkin sampai kepada penyedia awan lain.
Namun, perjanjian itu menggariskan peralihan yang lebih luas dalam perkakasan AI: andaian bahawa seni bina GPU tunggal akan berfungsi pada setiap peringkat saluran paip AI adalah bercanggah. Jika AMD dan Cerebras boleh menyampaikan tuntutan kecekapan mereka, inferens terbahagi boleh menjadi sebahagian standard cara sistem AI terbesar dibina.
Kekal Mendahului AI
Landskap perkakasan AI berpecah kepada kem khusus, dan implikasi untuk kos, kelajuan dan persaingan adalah sangat besar. Baca lebih banyak berita AI di AI Buzz Wire untuk mengikuti setiap tawaran utama, keluaran dan penanda aras.


