Nvidia wis nggawe akselerator inferensi interaktif Groq 3 LPX dadi produksi lengkap, perusahaan kasebut ngumumake tanggal 24 Agustus 2026, sajrone konferensi Kripik Panas. Chip kasebut, tambahan saka platform Vera Rubin Nvidia, ngirim rekor 3,400 token output per detik ing benchmarking Analisis Artificial nalika mbukak model Gemma 4 31B open-source kanthi jendela konteks 100,000-token sing aktif - kinerja paling cepet sing direkam kanggo model kasebut.

Peluncuran kasebut nandhani tonggak sejarah produk sing paling penting saka Nvidia $ 20 milyar akuisisi spesialis inferensi Groq, kesepakatan sing saiki ditindakake perusahaan kanggo entuk manfaat amarga panjaluk mundhak inferensi latensi rendah. CNBC kacarita Nvidia ngandika rak Groq pisanan bakal online sadurunge pungkasan taun. Kanggo konteks liyane babagan crita iki, deleng [liputan industri AI] (https://aibuzzwire.news).

Napa Kacepetan Generasi Token Penting

Sistem AI Agentic - program sing alesan, nelpon alat, nulis lan kode test, lan iterate liwat atusan utawa ewu langkah inferensi - ngasilake volume gedhe tenan token output. Kacepetan nalika token kasebut diprodhuksi, dikenal minangka interaktivitas utawa decode throughput, nemtokake sepira cepet agen bisa ngrampungake saben langkah kerjane.

Nvidia ujar Groq 3 LPX nyedhiyakake responsif 4x luwih cepet kanggo agen lan beban kerja sing sensitif latensi tinimbang platform alternatif sing paling cedhak. Ing panyebaran heterogen, sistem Vera Rubin NVL72 nangani ingestion konteks lan komputasi praisi, dene unit Groq 3 LPX ngolah fase generasi token sensitif latensi.

"Inferensi minangka mesin pertumbuhan AI," ujare Jensen Huang, pangadeg lan CEO Nvidia, ing woro-woro kasebut. "Vera Rubin ngluwihi visi kasebut kanthi konfigurasi pabrik AI sing dioptimalake kanggo beban kerja sing dirancang kanggo jaman AI agenik, ningkatake wates kinerja kanthi LPX kanggo generasi token ultrafast."

Ing Hardware

Miturut analisis teknis StorageReview, saben tray komputasi 2U sing adhem cairan nggawa nembelas Groq 3 LPU bebarengan karo CPU host, logika ekspansi kain, lan DRAM, ditambah karo BlueField-4 DPU utawa kertu jaringan ConnectX-9. Baki kasebut nduweni 32 link optik chip-to-chip LPU lan Ethernet 400Gb/s ing panel ngarep.

Ing skala rak, penyebaran Groq 3 LPX nggabungake nganti 256 akselerator LP30 sing disambung liwat interkoneksi chip-to-chip kanthi kacepetan dhuwur. Rak slot menyang infrastruktur pabrik Nvidia Vera Rubin AI sing luwih jembar, sing perusahaan kasebut minangka platform paling ekstensif: pitung chip diskrèt ing limang konfigurasi rak sing dibangun kanthi tujuan, kalebu DPU BlueField-4, rak CPU Vera, panyimpenan Vera BlueField-4 STX, lan jaringan Spectrum-6 SPX Ethernet.

Nvidia uga nyegerake pratelan kinerja tingkat platform, nyatakake yen Vera Rubin NVL72 ngirim nganti 30 kaping throughput token saben megawatt dibandhingake karo GB300 NVL72 ing beban kerja coding agenik 140,000-token, kanthi kauntungan nambah nalika target interaktivitas saben pangguna mundhak.

Benchmark Kanthi Bintang

Judhul 3,400 token-per-detik tokoh dilengkapi karo caveat worth kang lagi nyimak. Minangka StorageReview nuding metu, asil Nvidia diukur ing endpoint pra-rilis pribadi ing Agustus 21, nalika nomer saingan dibandhingake karo teka saka endpoints produksi tanpa server langsung. Kinerja nyata ing layanan sing umume kasedhiya bisa beda karo konfigurasi pathokan nyetel rekaman.

Isih, organisasi benchmarking independen Analisis Artificial nyathet asil minangka sing paling cepet sing diukur kanggo Gemma 4 31B ing dawa konteks kasebut, lan pratelan sing ndasari - silikon sing dibangun kanthi tujuan bisa nyepetake fase inferensi kanthi dramatis - selaras karo carane industri wis ngrancang maneh kanggo beban kerja agen.

Adoption Cloud Diwiwiti

Nebius, awan AI sing berkantor pusat ing Amsterdam, minangka panyedhiya pisanan sing komitmen kanggo nyebarake Groq 3 LPX, ngrancang nggawa menyang Pabrik Token Nebius, platform inferensi produksi.

"Generasi minangka fase inferensi sing nemtokake cara responsif sistem AI, lan persis apa NVIDIA Groq 3 LPX dibangun kanggo nyepetake," ujare Danila Shtan, kepala pejabat teknologi Nebius. "Minangka maya AI pisanan sing nggawa menyang produksi liwat Pabrik Token Nebius, kita nggawe manawa saben langkah saka loop agen krasa cepet - liwat pangembang API sing padha wis digunakake, tanpa migrasi menyang tumpukan anyar."

Panyedhiya inferensi Groq, saiki dadi bagean saka kulawarga Nvidia, ngrancang dadi salah sawijining pangguna paling awal ing platform kasebut.

Gambar sing luwih gedhe

Pengumuman produksi lengkap menehi tandha sepira cetha pasar infrastruktur AI wis pivoted saka latihan kanggo inferensi. Nalika perusahaan ngowahi anggaran saka pra-latihan model mentah menyang pertimbangan wektu nyata lan orkestrasi agen otonom, ekonomi token - sepira cepet bisa digawe lan biaya energi - wis dadi medan perang kompetitif pusat.

Kanggo Nvidia, Groq 3 LPX ngluwihi pertahanan waralaba pabrik AI nalika silikon khusus saka panyedhiya awan lan wiwitan padha nguber beban kerja inferensi agen sing padha. Rak teka online taun iki, minangka CNBC kacarita, bakal sijine sistem produksi pisanan ing tangan pelanggan sasi sawise akuisisi ditutup - integrasi cepet dening standar industri semikonduktor.

Perusahaan ora ngumumake rega kanggo sistem anyar kasebut. Groq 3 LPX bakal ditawakake kanthi basis kapan-lan-yen-kasedhiya liwat mitra awan AI, kanthi Nebius samesthine dadi sing pertama nawakake akses menyang pangembang liwat titik pungkasan API sing wis ana.

---

Tetep Ahead of AI

Entuk warta, analisis, lan terobosan AI paling anyar - kabeh ing sak panggonan.

Waca liyane AI warta →