Nvidia telah meletakkan pemecut inferens interaktif Groq 3 LPX ke dalam pengeluaran penuh, syarikat itu mengumumkan pada 24 Ogos 2026, semasa persidangan Hot Chips. Cip itu, lanjutan daripada platform Vera Rubin Nvidia, menyampaikan rekod 3,400 token keluaran sesaat dalam penanda aras Analisis Buatan semasa menjalankan model Gemma 4 31B sumber terbuka dengan tetingkap konteks 100,000 token aktif — prestasi terpantas pernah direkodkan untuk model itu.
Pelancaran itu menandakan pencapaian produk yang paling penting daripada pengambilalihan pakar inferens Nvidia bernilai $20 bilion, Groq, perjanjian yang kini sedang digerakkan oleh syarikat untuk memanfaatkannya apabila permintaan untuk lonjakan inferens kependaman rendah. CNBC melaporkan bahawa Nvidia mengatakan rak Groq pertama akan berada dalam talian sebelum akhir tahun ini. Untuk lebih banyak konteks tentang cerita ini, lihat [liputan industri AI] kami yang berterusan (https://aibuzzwire.news).
Mengapa Kelajuan Penjanaan Token Penting
Sistem AI Agentik — atur cara yang menaakul, memanggil alat, menulis dan menguji kod, dan melelang merentasi ratusan atau ribuan langkah inferens — menjana volum besar token output. Kelajuan token tersebut dihasilkan, yang dikenali sebagai interaktiviti atau proses penyahkod, menentukan seberapa cepat ejen boleh menyelesaikan setiap langkah kerjanya.
Nvidia berkata Groq 3 LPX menyediakan responsif 4x lebih pantas untuk ejen dan beban kerja sensitif kependaman daripada platform alternatif terdekat. Dalam penggunaan heterogen, sistem Vera Rubin NVL72 mengendalikan pengingesan konteks dan pengiraan praisi, manakala unit Groq 3 LPX memproses fasa penjanaan token sensitif kependaman.
"Inferens ialah enjin pertumbuhan AI," kata Jensen Huang, pengasas dan Ketua Pegawai Eksekutif Nvidia, dalam pengumuman itu. "Vera Rubin meluaskan visi itu dengan konfigurasi kilang AI yang dioptimumkan beban kerja yang direka untuk era AI agenik, memajukan sempadan prestasi dengan LPX untuk penjanaan token ultra cepat."
Di dalam Perkakasan
Menurut analisis teknikal StorageReview, setiap dulang pengiraan penyejuk cecair 2U membawa enam belas LPU Groq 3 bersama CPU hos, logik pengembangan fabrik dan DRAM, ditambah sama ada BlueField-4 DPU atau kad rangkaian ConnectX-9. Dulang mempunyai 32 pautan optik cip-ke-cip LPU dan Ethernet 400Gb/s pada panel hadapan.
Pada skala rak, penggunaan Groq 3 LPX menggabungkan sehingga 256 pemecut LP30 yang dipautkan melalui sambungan cip-ke-cip terus berkelajuan tinggi. Rak itu masuk ke dalam infrastruktur kilang Vera Rubin AI Nvidia yang lebih luas, yang disifatkan syarikat sebagai platformnya yang paling luas: tujuh cip diskret merentas lima konfigurasi rak yang dibina khas, termasuk DPU BlueField-4, rak CPU Vera, storan Vera BlueField-4 STX dan rangkaian Ethernet Spectrum-6 SPX.
Nvidia juga memperbaharui tuntutan prestasi peringkat platformnya, dengan menyatakan bahawa Vera Rubin NVL72 menyampaikan sehingga 30 kali daya daya token bagi setiap megawatt berbanding GB300 NVL72 pada beban kerja pengekodan agenik 140,000 token, dengan kelebihan semakin meluas apabila sasaran interaktiviti setiap pengguna meningkat.
Penanda Aras Dengan Asterisk
Tajuk angka 3,400 token-sesaat disertakan dengan kaveat yang perlu diberi perhatian. Seperti yang dinyatakan oleh StorageReview, keputusan Nvidia diukur pada titik akhir pra-keluaran peribadi pada 21 Ogos, manakala nombor bersaing yang dibandingkan dengannya datang daripada titik akhir pengeluaran tanpa pelayan secara langsung. Prestasi dunia sebenar pada perkhidmatan yang tersedia secara umum mungkin berbeza daripada konfigurasi penanda aras penetapan rekod.
Namun, organisasi penanda aras bebas Analisis Buatan merekodkan hasilnya sebagai yang terpantas pernah diukur untuk Gemma 4 31B pada panjang konteks tersebut, dan dakwaan asas — silikon yang dibina khas itu boleh mempercepatkan fasa penyahkod inferens secara mendadak — sejajar dengan cara industri telah mereka bina semula untuk beban kerja agen.
Penerimaan Awan Bermula
Nebius, awan AI yang beribu pejabat di Amsterdam, ialah penyedia pertama yang komited untuk menggunakan Groq 3 LPX, merancang untuk membawanya ke Nebius Token Factory, platform inferens pengeluarannya.
"Penjanaan ialah fasa inferens yang menentukan sejauh mana responsif sistem AI sebenarnya, dan itulah yang dibina NVIDIA Groq 3 LPX untuk mempercepatkan," kata Danila Shtan, ketua pegawai teknologi Nebius. "Sebagai awan AI pertama yang membawanya ke pengeluaran melalui Kilang Token Nebius, kami memastikan setiap langkah gelung ejen terasa serta-merta — melalui pembangun API yang sama telah pun digunakan, tanpa pemindahan ke timbunan baharu."
Penyedia inferens Groq, kini sebahagian daripada keluarga Nvidia, merancang untuk menjadi antara pengguna terawal platform itu.
Gambaran Lebih Besar
Pengumuman pengeluaran penuh menandakan betapa tajamnya pasaran infrastruktur AI telah berputar daripada latihan kepada inferens. Memandangkan perusahaan mengalihkan belanjawan daripada pra-latihan model mentah kepada penaakulan masa nyata dan orkestrasi ejen autonomi, ekonomi token — seberapa pantas ia boleh dijana dan pada kos tenaga — telah menjadi medan pertempuran utama yang kompetitif.
Untuk Nvidia, Groq 3 LPX memperluaskan pertahanan francais kilang AInya pada ketika silikon tersuai daripada pembekal awan dan syarikat pemula sama-sama mengejar beban kerja inferens agen yang sama. Rak yang akan datang dalam talian tahun ini, seperti yang dilaporkan CNBC, akan meletakkan sistem pengeluaran pertama di tangan pelanggan beberapa bulan selepas pemerolehan ditutup — penyepaduan pantas oleh piawaian industri semikonduktor.
Syarikat itu tidak mendedahkan harga untuk sistem baharu itu. Groq 3 LPX akan ditawarkan pada asas bila dan jika tersedia melalui rakan kongsi awan AI, dengan Nebius dijangka menjadi yang pertama menawarkan akses kepada pembangun melalui titik akhir API sedia ada.
---
Kekal Mendahului AIDapatkan berita, analisis dan penemuan terkini AI — semuanya di satu tempat.
Baca lebih banyak berita AI →