Şirket, 24 Ağustos 2026'da Hot Chips konferansı sırasında yaptığı duyuruda, Nvidia'nın Groq 3 LPX etkileşimli çıkarım hızlandırıcısını tam üretime geçirdiğini duyurdu. Nvidia'nın Vera Rubin platformunun bir uzantısı olan çip, açık kaynaklı Gemma 4 31B modelini aktif 100.000 jetonluk bağlam penceresiyle çalıştırırken Yapay Analiz kıyaslamasında saniyede 3.400 jeton çıkışı rekoru sağladı; bu model için şimdiye kadar kaydedilen en hızlı performans.
Lansman, Nvidia'nın 20 milyar dolarlık çıkarım uzmanı Groq'u satın almasından bugüne kadarki en önemli ürün kilometre taşını işaret ediyor; bu anlaşma, şirketin düşük gecikmeli çıkarımlara yönelik talebin artması nedeniyle şimdi faydalanmaya yöneldiği bir anlaşma. CNBC, Nvidia'nın ilk Groq raflarının yıl sonundan önce çevrimiçi olacağını söylediğini bildirdi. Bu hikayeyle ilgili daha fazla bağlam için devam eden AI sektörü haberimize bakın.
Token Üretim Hızı Neden Önemlidir
Ajansal AI sistemleri (akıl yürüten, araçları çağıran, kod yazan ve test eden ve yüzlerce veya binlerce çıkarım adımını yineleyen programlar) muazzam hacimlerde çıktı tokenleri üretir. Etkileşim veya kod çözme verimi olarak bilinen bu tokenlerin üretilme hızı, bir aracının işinin her adımını ne kadar hızlı tamamlayabileceğini belirler.
Nvidia, Groq 3 LPX'in aracılar ve gecikmeye duyarlı iş yükleri için en yakın alternatif platforma göre 4 kat daha hızlı yanıt verme yeteneği sağladığını söylüyor. Heterojen dağıtımlarda Vera Rubin NVL72 sistemleri bağlam alımını ve ön doldurma hesaplamasını yönetirken, Groq 3 LPX birimleri gecikmeye duyarlı jeton oluşturma aşamasını işler.
Duyuruda Nvidia'nın kurucusu ve CEO'su Jensen Huang, "Çıkarım yapay zekanın büyüme motorudur" dedi. "Vera Rubin, ajansal yapay zeka çağı için tasarlanan iş yükü optimize edilmiş yapay zeka fabrika yapılandırmalarıyla bu vizyonu genişletiyor ve ultra hızlı token üretimi için LPX ile performans sınırını ilerletiyor."
Donanımın İçinde
StorageReview'un teknik analizine göre, her bir 2U sıvı soğutmalı bilgi işlem tepsisi, bir ana CPU, yapı genişletme mantığı ve DRAM'in yanı sıra bir BlueField-4 DPU veya ConnectX-9 ağ kartının yanı sıra on altı Groq 3 LPU taşır. Tepside 32 LPU çipten çipe optik bağlantı ve ön panelde 400 Gb/s Ethernet bulunur.
Raf ölçeğinde bir Groq 3 LPX dağıtımı, yüksek hızlı, doğrudan yongadan yongaya ara bağlantılarla bağlanan 256 adede kadar LP30 hızlandırıcıyı içerir. Raflar, şirketin şimdiye kadarki en kapsamlı platformu olarak tanımladığı Nvidia'nın daha geniş Vera Rubin AI fabrika altyapısına giriyor: BlueField-4 DPU'lar, Vera CPU rafları, Vera BlueField-4 STX depolama ve Spectrum-6 SPX Ethernet ağı dahil olmak üzere amaca yönelik olarak oluşturulmuş beş raf konfigürasyonunda yedi ayrı çip.
Nvidia ayrıca platform düzeyindeki performans iddialarını da yenileyerek Vera Rubin NVL72'nin, 140.000 jetonluk ajansal kodlama iş yükünde GB300 NVL72 ile karşılaştırıldığında megavat başına 30 kata kadar daha fazla token verimi sağladığını ve kullanıcı başına etkileşim hedefleri arttıkça avantajın arttığını belirtti.
Yıldız İşaretli Bir Karşılaştırma Ölçütü
Saniyede 3.400 jeton rakamının manşeti, dikkate değer bir uyarıyı da beraberinde getiriyor. StorageReview'ın işaret ettiği gibi, Nvidia'nın sonucu 21 Ağustos'ta özel bir yayın öncesi uç noktada ölçüldü; karşılaştırılan rakip rakamlar ise canlı sunucusuz üretim uç noktalarından geldi. Genel olarak kullanılabilen hizmetlerdeki gerçek dünya performansı, rekor kıran kıyaslama yapılandırmasından farklı olabilir.
Yine de bağımsız kıyaslama kuruluşu Yapay Analiz, sonucu Gemma 4 31B için bu bağlam uzunluğunda şimdiye kadar ölçülen en hızlı sonuç olarak kaydetti ve bunun altında yatan iddia (amaca yönelik tasarlanmış silikonun çıkarımın kod çözme aşamasını önemli ölçüde hızlandırabileceği) endüstrinin aracı iş yükleri için nasıl yeniden tasarladığıyla uyumlu.
Bulut Benimsemeye Başlıyor
Amsterdam merkezli yapay zeka bulutu Nebius, Groq 3 LPX'i dağıtmayı taahhüt eden ve onu üretim çıkarım platformu Nebius Token Factory'ye getirmeyi planlayan ilk sağlayıcıdır.
Nebius'un baş teknoloji sorumlusu Danila Shtan, "Nesil, bir yapay zeka sisteminin gerçekte ne kadar duyarlı olduğunu belirleyen çıkarım aşamasıdır ve NVIDIA Groq 3 LPX'in hızlandırmak için tasarlandığı şey de tam olarak budur" dedi. "Nebius Token Factory aracılığıyla onu üretime getiren ilk AI bulutu olarak, bir aracının döngüsünün her adımının anında hissedilmesini sağlıyoruz - geliştiricilerin halihazırda kullandığı aynı API aracılığıyla, yeni bir yığına geçiş yapmadan."
Artık Nvidia ailesinin bir parçası olan çıkarım sağlayıcı Groq, platformu ilk benimseyenlerden biri olmayı planlıyor.
Büyük Resim
Tam üretim duyurusu, yapay zeka altyapı pazarının eğitimden çıkarımlara ne kadar keskin bir dönüş yaptığını gösteriyor. İşletmeler bütçelerini ham model ön eğitiminden gerçek zamanlı muhakeme ve otonom aracı orkestrasyonuna kaydırdıkça, bir tokenin ekonomisi (ne kadar hızlı üretilebileceği ve hangi enerji maliyetiyle) merkezi rekabet savaş alanı haline geldi.
Nvidia için Groq 3 LPX, bulut sağlayıcıları ve startup şirketlerinin özel silikonlarının aynı ajansal çıkarım iş yüklerini takip ettiği bir dönemde yapay zeka fabrika serisinin savunmasını genişletiyor. CNBC'nin bildirdiği gibi, bu yıl çevrimiçi hale gelen raflar, satın almanın kapanmasından aylar sonra ilk üretim sistemlerini müşterilerin eline sunacak; bu, yarı iletken endüstri standartlarına göre hızlı bir entegrasyon.
Şirket, yeni sistemlerin fiyatını açıklamadı. Groq 3 LPX, AI bulut ortakları aracılığıyla ne zaman ve ne zaman mevcut olursa sunulacak ve Nebius'un mevcut API uç noktaları aracılığıyla geliştiricilere erişim sunan ilk şirket olması bekleniyor.
---
Yapay Zekanın Önünde OlunEn son AI haberlerini, analizlerini ve buluşlarını tek bir yerden alın.
Daha fazla AI haberini okuyun →