انویدیا شتابدهنده استنتاج تعاملی Groq 3 LPX خود را در مرحله تولید کامل قرار داده است، این شرکت در 24 آگوست 2026 در جریان کنفرانس Hot Chips اعلام کرد. این تراشه که توسعه پلتفرم Vera Rubin انویدیا است، با اجرای مدل منبع باز Gemma 4 31B با یک پنجره زمینه فعال 100000 توکن، رکورد 3400 توکن خروجی در ثانیه را در محک گذاری تحلیل مصنوعی ارائه کرد - سریع ترین عملکرد ثبت شده برای آن مدل.
این راهاندازی، مهمترین نقطه عطف محصول تاکنون از خرید 20 میلیارد دلاری انویدیا متخصص استنباط Groq است، معاملهای که این شرکت اکنون در حال حرکت به سمت سرمایهگذاری روی آن است زیرا تقاضا برای استنتاج با تأخیر کم افزایش یافته است. CNBC گزارش داد که انویدیا می گوید اولین رک های Groq قبل از پایان سال آنلاین خواهند شد. برای زمینه بیشتر در مورد این داستان، [پوشش صنعت هوش مصنوعی] (https://aibuzzwire.news) را ببینید.
چرا سرعت تولید توکن مهم است
سیستمهای هوش مصنوعی - برنامههایی که استدلال میکنند، ابزارها را فراخوانی میکنند، کد مینویسند و آزمایش میکنند، و در صدها یا هزاران مرحله استنتاج تکرار میکنند - حجم عظیمی از نشانههای خروجی تولید میکنند. سرعت تولید آن توکنها، که به عنوان تعامل یا عملیات رمزگشایی شناخته میشود، تعیین میکند که یک عامل با چه سرعتی میتواند هر مرحله از کار خود را تکمیل کند.
انویدیا میگوید Groq 3 LPX نسبت به نزدیکترین پلتفرم جایگزین، ۴ برابر سریعتر پاسخدهی را برای عوامل و بارهای کاری حساس به تأخیر ارائه میکند. در استقرارهای ناهمگن، سیستمهای Vera Rubin NVL72 پردازش متن و محاسبات پیشپر را انجام میدهند، در حالی که واحدهای Groq 3 LPX فاز تولید توکن حساس به تأخیر را پردازش میکنند.
جنسن هوانگ، بنیانگذار و مدیرعامل انویدیا در این اطلاعیه گفت: «استنتاج موتور رشد هوش مصنوعی است. Vera Rubin این چشم انداز را با پیکربندی های کارخانه ای هوش مصنوعی بهینه سازی شده با حجم کار که برای عصر هوش مصنوعی طراحی شده است، گسترش می دهد و مرز عملکرد را با LPX برای تولید توکن فوق سریع پیش می برد.
داخل سخت افزار
طبق تجزیه و تحلیل فنی StorageReview، هر سینی محاسباتی خنکشده با مایع 2U، شانزده LPU Groq 3 را در کنار یک CPU میزبان، منطق توسعه فابریک و DRAM، بهعلاوه یک DPU BlueField-4 یا یک کارت شبکه ConnectX-9 حمل میکند. سینی دارای 32 پیوند نوری تراشه به تراشه LPU و اترنت 400 گیگابیت بر ثانیه در پنل جلویی است.
در مقیاس رک، استقرار Groq 3 LPX دارای حداکثر 256 شتاب دهنده LP30 است که از طریق اتصالات مستقیم تراشه به تراشه با سرعت بالا وصل شده اند. این رکها در زیرساختهای گستردهتر کارخانه انویدیا Vera Rubin AI جای میگیرند، که این شرکت آن را گستردهترین پلتفرم تا کنون توصیف میکند: هفت تراشه مجزا در پنج پیکربندی رک هدفمند، از جمله BlueField-4 DPU، قفسههای CPU Vera، Vera BlueField-4 STX و شبکه Spectrum Enet6.
انویدیا همچنین ادعاهای عملکرد سطح پلتفرم خود را تجدید کرد و اظهار داشت که Vera Rubin NVL72 در مقایسه با GB300 NVL72 در یک بار کاری کدگذاری عاملی 140000 توکن تا 30 برابر توان توکن در هر مگاوات ارائه میدهد و با افزایش اهداف تعاملی هر کاربر، مزیت آن افزایش مییابد.
یک معیار با یک ستاره
رقم تیتر 3400 توکن در ثانیه همراه با نکته ای است که قابل ذکر است. همانطور که StorageReview اشاره کرد، نتیجه انویدیا در یک نقطه پایانی پیش از انتشار خصوصی در 21 آگوست اندازه گیری شد، در حالی که اعداد رقابتی که با آن مقایسه شد، از نقاط پایانی تولید بدون سرور زنده بودند. عملکرد دنیای واقعی در سرویسهای عموماً در دسترس ممکن است با پیکربندی معیار تنظیم رکورد متفاوت باشد.
با این حال، سازمان سنجش مستقل Artificial Analysis نتیجه را بهعنوان سریعترین نتیجه اندازهگیری شده برای Gemma 4 31B در آن طول زمینه ثبت کرد، و ادعای اساسی - که سیلیکون ساختهشده بهمنظور میتواند به طور چشمگیری مرحله رمزگشایی استنتاج را تسریع بخشد - با نحوه معماری مجدد صنعت برای بارهای کار عاملی مطابقت دارد.
پذیرش ابر آغاز می شود
Nebius، ابر هوش مصنوعی که مقر آن در آمستردام است، اولین ارائه دهنده ای است که متعهد به استقرار Groq 3 LPX است و قصد دارد آن را به کارخانه توکن Nebius، پلتفرم استنتاج تولید خود بیاورد.
Danila Shtan، مدیر ارشد فناوری Nebius میگوید: «نسل مرحله استنتاج است که تعیین میکند یک سیستم هوش مصنوعی در واقع چقدر پاسخگو باشد، و این دقیقاً همان چیزی است که NVIDIA Groq 3 LPX برای شتابدادن ساخته شده است». به عنوان اولین ابر هوش مصنوعی که آن را از طریق Nebius Token Factory به تولید میرساند، مطمئن میشویم که هر مرحله از حلقه یک عامل فوری احساس میشود – از طریق همان توسعهدهندگان API که قبلاً از آن استفاده میکنند، بدون مهاجرت به پشته جدید.»
ارائهدهنده استنتاج Groq که اکنون بخشی از خانواده انویدیا است، قصد دارد یکی از اولین کاربران این پلتفرم باشد.
تصویر بزرگتر
اعلام تولید کامل نشان میدهد که بازار زیرساختهای هوش مصنوعی چقدر از آموزش به استنتاج تغییر کرده است. از آنجایی که شرکتها بودجهها را از پیشآموزش مدل خام به سمت استدلال در زمان واقعی و هماهنگسازی عامل مستقل تغییر میدهند، اقتصاد یک نشانه – با چه سرعتی میتواند تولید شود و با چه هزینهای انرژی – به میدان اصلی رقابت رقابتی تبدیل شده است.
برای انویدیا، Groq 3 LPX در زمانی که سیلیکون سفارشی ارائهدهندگان ابری و استارتآپها به طور یکسان در حال تعقیب بارهای کاری استنتاج عاملی هستند، دفاع از امتیاز کارخانه هوش مصنوعی خود را گسترش میدهد. همانطور که CNBC گزارش داد، رکهایی که امسال آنلاین میشوند، اولین سیستمهای تولیدی را ماهها پس از بسته شدن خرید در اختیار مشتریان قرار میدهند - یک ادغام سریع با استانداردهای صنعت نیمهرسانا.
این شرکت قیمت سیستم های جدید را فاش نکرد. Groq 3 LPX بر اساس زمانی و در صورت در دسترس بودن از طریق شرکای ابری هوش مصنوعی ارائه می شود و انتظار می رود Nebius اولین کسی باشد که از طریق نقاط پایانی API موجود خود به توسعه دهندگان دسترسی می دهد.
---
از هوش مصنوعی جلوتر بمانیدآخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.
بیشتر بخوانید اخبار هوش مصنوعی →