انویدیا شتاب‌دهنده استنتاج تعاملی Groq 3 LPX خود را در مرحله تولید کامل قرار داده است، این شرکت در 24 آگوست 2026 در جریان کنفرانس Hot Chips اعلام کرد. این تراشه که توسعه پلتفرم Vera Rubin انویدیا است، با اجرای مدل منبع باز Gemma 4 31B با یک پنجره زمینه فعال 100000 توکن، رکورد 3400 توکن خروجی در ثانیه را در محک گذاری تحلیل مصنوعی ارائه کرد - سریع ترین عملکرد ثبت شده برای آن مدل.

این راه‌اندازی، مهم‌ترین نقطه عطف محصول تاکنون از خرید 20 میلیارد دلاری انویدیا متخصص استنباط Groq است، معامله‌ای که این شرکت اکنون در حال حرکت به سمت سرمایه‌گذاری روی آن است زیرا تقاضا برای استنتاج با تأخیر کم افزایش یافته است. CNBC گزارش داد که انویدیا می گوید اولین رک های Groq قبل از پایان سال آنلاین خواهند شد. برای زمینه بیشتر در مورد این داستان، [پوشش صنعت هوش مصنوعی] (https://aibuzzwire.news) را ببینید.

چرا سرعت تولید توکن مهم است

سیستم‌های هوش مصنوعی - برنامه‌هایی که استدلال می‌کنند، ابزارها را فراخوانی می‌کنند، کد می‌نویسند و آزمایش می‌کنند، و در صدها یا هزاران مرحله استنتاج تکرار می‌کنند - حجم عظیمی از نشانه‌های خروجی تولید می‌کنند. سرعت تولید آن توکن‌ها، که به عنوان تعامل یا عملیات رمزگشایی شناخته می‌شود، تعیین می‌کند که یک عامل با چه سرعتی می‌تواند هر مرحله از کار خود را تکمیل کند.

انویدیا می‌گوید Groq 3 LPX نسبت به نزدیک‌ترین پلتفرم جایگزین، ۴ برابر سریع‌تر پاسخ‌دهی را برای عوامل و بارهای کاری حساس به تأخیر ارائه می‌کند. در استقرارهای ناهمگن، سیستم‌های Vera Rubin NVL72 پردازش متن و محاسبات پیش‌پر را انجام می‌دهند، در حالی که واحدهای Groq 3 LPX فاز تولید توکن حساس به تأخیر را پردازش می‌کنند.

جنسن هوانگ، بنیانگذار و مدیرعامل انویدیا در این اطلاعیه گفت: «استنتاج موتور رشد هوش مصنوعی است. Vera Rubin این چشم انداز را با پیکربندی های کارخانه ای هوش مصنوعی بهینه سازی شده با حجم کار که برای عصر هوش مصنوعی طراحی شده است، گسترش می دهد و مرز عملکرد را با LPX برای تولید توکن فوق سریع پیش می برد.

داخل سخت افزار

طبق تجزیه و تحلیل فنی StorageReview، هر سینی محاسباتی خنک‌شده با مایع 2U، شانزده LPU Groq 3 را در کنار یک CPU میزبان، منطق توسعه فابریک و DRAM، به‌علاوه یک DPU BlueField-4 یا یک کارت شبکه ConnectX-9 حمل می‌کند. سینی دارای 32 پیوند نوری تراشه به تراشه LPU و اترنت 400 گیگابیت بر ثانیه در پنل جلویی است.

در مقیاس رک، استقرار Groq 3 LPX دارای حداکثر 256 شتاب دهنده LP30 است که از طریق اتصالات مستقیم تراشه به تراشه با سرعت بالا وصل شده اند. این رک‌ها در زیرساخت‌های گسترده‌تر کارخانه انویدیا Vera Rubin AI جای می‌گیرند، که این شرکت آن را گسترده‌ترین پلت‌فرم تا کنون توصیف می‌کند: هفت تراشه مجزا در پنج پیکربندی رک هدفمند، از جمله BlueField-4 DPU، قفسه‌های CPU Vera، Vera BlueField-4 STX و شبکه Spectrum Enet6.

انویدیا همچنین ادعاهای عملکرد سطح پلتفرم خود را تجدید کرد و اظهار داشت که Vera Rubin NVL72 در مقایسه با GB300 NVL72 در یک بار کاری کدگذاری عاملی 140000 توکن تا 30 برابر توان توکن در هر مگاوات ارائه می‌دهد و با افزایش اهداف تعاملی هر کاربر، مزیت آن افزایش می‌یابد.

یک معیار با یک ستاره

رقم تیتر 3400 توکن در ثانیه همراه با نکته ای است که قابل ذکر است. همانطور که StorageReview اشاره کرد، نتیجه انویدیا در یک نقطه پایانی پیش از انتشار خصوصی در 21 آگوست اندازه گیری شد، در حالی که اعداد رقابتی که با آن مقایسه شد، از نقاط پایانی تولید بدون سرور زنده بودند. عملکرد دنیای واقعی در سرویس‌های عموماً در دسترس ممکن است با پیکربندی معیار تنظیم رکورد متفاوت باشد.

با این حال، سازمان سنجش مستقل Artificial Analysis نتیجه را به‌عنوان سریع‌ترین نتیجه اندازه‌گیری شده برای Gemma 4 31B در آن طول زمینه ثبت کرد، و ادعای اساسی - که سیلیکون ساخته‌شده به‌منظور می‌تواند به طور چشمگیری مرحله رمزگشایی استنتاج را تسریع بخشد - با نحوه معماری مجدد صنعت برای بارهای کار عاملی مطابقت دارد.

پذیرش ابر آغاز می شود

Nebius، ابر هوش مصنوعی که مقر آن در آمستردام است، اولین ارائه دهنده ای است که متعهد به استقرار Groq 3 LPX است و قصد دارد آن را به کارخانه توکن Nebius، پلتفرم استنتاج تولید خود بیاورد.

Danila Shtan، مدیر ارشد فناوری Nebius می‌گوید: «نسل مرحله استنتاج است که تعیین می‌کند یک سیستم هوش مصنوعی در واقع چقدر پاسخگو باشد، و این دقیقاً همان چیزی است که NVIDIA Groq 3 LPX برای شتاب‌دادن ساخته شده است». به عنوان اولین ابر هوش مصنوعی که آن را از طریق Nebius Token Factory به تولید می‌رساند، مطمئن می‌شویم که هر مرحله از حلقه یک عامل فوری احساس می‌شود – از طریق همان توسعه‌دهندگان API که قبلاً از آن استفاده می‌کنند، بدون مهاجرت به پشته جدید.»

ارائه‌دهنده استنتاج Groq که اکنون بخشی از خانواده انویدیا است، قصد دارد یکی از اولین کاربران این پلتفرم باشد.

تصویر بزرگتر

اعلام تولید کامل نشان می‌دهد که بازار زیرساخت‌های هوش مصنوعی چقدر از آموزش به استنتاج تغییر کرده است. از آنجایی که شرکت‌ها بودجه‌ها را از پیش‌آموزش مدل خام به سمت استدلال در زمان واقعی و هماهنگ‌سازی عامل مستقل تغییر می‌دهند، اقتصاد یک نشانه – با چه سرعتی می‌تواند تولید شود و با چه هزینه‌ای انرژی – به میدان اصلی رقابت رقابتی تبدیل شده است.

برای انویدیا، Groq 3 LPX در زمانی که سیلیکون سفارشی ارائه‌دهندگان ابری و استارت‌آپ‌ها به طور یکسان در حال تعقیب بارهای کاری استنتاج عاملی هستند، دفاع از امتیاز کارخانه هوش مصنوعی خود را گسترش می‌دهد. همانطور که CNBC گزارش داد، رک‌هایی که امسال آنلاین می‌شوند، اولین سیستم‌های تولیدی را ماه‌ها پس از بسته شدن خرید در اختیار مشتریان قرار می‌دهند - یک ادغام سریع با استانداردهای صنعت نیمه‌رسانا.

این شرکت قیمت سیستم های جدید را فاش نکرد. Groq 3 LPX بر اساس زمانی و در صورت در دسترس بودن از طریق شرکای ابری هوش مصنوعی ارائه می شود و انتظار می رود Nebius اولین کسی باشد که از طریق نقاط پایانی API موجود خود به توسعه دهندگان دسترسی می دهد.

---

از هوش مصنوعی جلوتر بمانید

آخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.

بیشتر بخوانید اخبار هوش مصنوعی →