Nvidia ได้นำตัวเร่งการอนุมานเชิงโต้ตอบ Groq 3 LPX ไปสู่การผลิตเต็มรูปแบบ บริษัท ประกาศเมื่อวันที่ 24 สิงหาคม 2569 ระหว่างการประชุม Hot Chips ชิปซึ่งเป็นส่วนเสริมของแพลตฟอร์ม Vera Rubin ของ Nvidia ส่งมอบโทเค็นเอาท์พุตสูงสุดเป็นประวัติการณ์ 3,400 โทเค็นต่อวินาทีในการวัดประสิทธิภาพการวิเคราะห์ประดิษฐ์ ในขณะที่ใช้งานโมเดลโอเพ่นซอร์ส Gemma 4 31B พร้อมหน้าต่างบริบทที่ใช้งานอยู่ 100,000 โทเค็น ซึ่งเป็นประสิทธิภาพที่เร็วที่สุดเท่าที่เคยมีการบันทึกสำหรับรุ่นนั้น
การเปิดตัวครั้งนี้นับเป็นความสำเร็จครั้งสำคัญของผลิตภัณฑ์จากการซื้อกิจการ Groq ผู้เชี่ยวชาญด้านการอนุมานของ Nvidia มูลค่า 2 หมื่นล้านดอลลาร์ ซึ่งเป็นข้อตกลงที่บริษัทกำลังดำเนินการเพื่อใช้ประโยชน์จากความต้องการการอนุมานที่มีความหน่วงต่ำเพิ่มขึ้น CNBC รายงานว่า Nvidia กล่าวว่าชั้นวาง Groq แรกจะออนไลน์ก่อนสิ้นปีนี้ หากต้องการทราบบริบทเพิ่มเติมเกี่ยวกับเรื่องราวนี้ โปรดดู ความครอบคลุมของอุตสาหกรรม AI ที่กำลังดำเนินอยู่
เหตุใดความเร็วในการสร้างโทเค็นจึงมีความสำคัญ
ระบบ Agentic AI — โปรแกรมที่ให้เหตุผล เรียกใช้เครื่องมือ เขียนและทดสอบโค้ด และวนซ้ำขั้นตอนการอนุมานหลายร้อยหรือหลายพัน — สร้างโทเค็นเอาท์พุตปริมาณมหาศาล ความเร็วในการผลิตโทเค็นเหล่านั้น หรือที่เรียกว่าการโต้ตอบหรือการถอดรหัส จะกำหนดความเร็วที่เอเจนต์สามารถดำเนินการแต่ละขั้นตอนให้เสร็จสิ้นได้เร็วเพียงใด
Nvidia กล่าวว่า Groq 3 LPX ให้การตอบสนองที่เร็วขึ้น 4 เท่าสำหรับเอเจนต์และปริมาณงานที่ไวต่อความหน่วงมากกว่าแพลตฟอร์มทางเลือกที่ใกล้ที่สุด ในการปรับใช้ที่แตกต่างกัน ระบบ Vera Rubin NVL72 จะจัดการการนำเข้าบริบทและการคำนวณการเติมล่วงหน้า ในขณะที่หน่วย Groq 3 LPX ประมวลผลเฟสการสร้างโทเค็นที่ไวต่อความหน่วง
“การอนุมานเป็นกลไกการเติบโตของ AI” Jensen Huang ผู้ก่อตั้งและ CEO ของ Nvidia กล่าวในการประกาศ "Vera Rubin ขยายวิสัยทัศน์ดังกล่าวด้วยการกำหนดค่าจากโรงงาน AI ที่ปรับให้เหมาะสมกับเวิร์กโหลด ซึ่งออกแบบมาสำหรับยุคของ AI แบบเอเจนต์ โดยยกระดับขอบเขตประสิทธิภาพด้วย LPX สำหรับการสร้างโทเค็นที่รวดเร็วเป็นพิเศษ"
ภายในฮาร์ดแวร์
ตามการวิเคราะห์ทางเทคนิคของ StorageReview ถาดประมวลผลระบายความร้อนด้วยของเหลวขนาด 2U แต่ละถาดจะบรรจุ Groq 3 LPU สิบหกตัว ควบคู่ไปกับ CPU โฮสต์ ลอจิกส่วนขยายแฟบริค และ DRAM รวมถึง BlueField-4 DPU หรือการ์ดเครือข่าย ConnectX-9 ถาดประกอบด้วยออปติคัลลิงก์แบบชิปต่อชิป 32 LPU และอีเธอร์เน็ต 400Gb/s ที่แผงด้านหน้า
ที่ระดับแร็ค การใช้งาน Groq 3 LPX จะรวมตัวเร่งความเร็ว LP30 มากถึง 256 ตัวที่เชื่อมโยงกันผ่านการเชื่อมต่อระหว่างกันแบบชิปต่อชิปโดยตรงความเร็วสูง ชั้นวางสล็อตเข้าไปในโครงสร้างพื้นฐานโรงงาน Vera Rubin AI ที่กว้างขึ้นของ Nvidia ซึ่งบริษัทอธิบายว่าเป็นแพลตฟอร์มที่กว้างขวางที่สุดเท่าที่เคยมีมา: ชิปแยกเจ็ดตัวในการกำหนดค่าชั้นวางห้าแบบที่สร้างขึ้นโดยเฉพาะ รวมถึง BlueField-4 DPUs, ชั้นวาง CPU Vera, พื้นที่เก็บข้อมูล Vera BlueField-4 STX และเครือข่าย Spectrum-6 SPX Ethernet
นอกจากนี้ Nvidia ยังรีเฟรชคำกล่าวอ้างประสิทธิภาพระดับแพลตฟอร์ม โดยระบุว่า Vera Rubin NVL72 ให้ปริมาณงานโทเค็นต่อเมกะวัตต์สูงถึง 30 เท่า เมื่อเทียบกับ GB300 NVL72 บนเวิร์กโหลดการเข้ารหัสเอเจนต์ 140,000 โทเค็น พร้อมข้อได้เปรียบที่กว้างขึ้นเมื่อเป้าหมายการโต้ตอบต่อผู้ใช้เพิ่มขึ้น
เกณฑ์มาตรฐานที่มีเครื่องหมายดอกจัน
ตัวเลข 3,400 โทเค็นต่อวินาทีพาดหัวมาพร้อมกับข้อควรสังเกตที่น่าสังเกต ตามที่ StorageReview ชี้ให้เห็น ผลลัพธ์ของ Nvidia ได้รับการวัดบนจุดสิ้นสุดก่อนเผยแพร่ส่วนตัวในวันที่ 21 สิงหาคม ในขณะที่ตัวเลขที่แข่งขันกันนั้นถูกนำมาเปรียบเทียบนั้นมาจากจุดสิ้นสุดที่ใช้งานจริงแบบไร้เซิร์ฟเวอร์ ประสิทธิภาพในโลกแห่งความเป็นจริงในบริการที่มีอยู่โดยทั่วไปอาจแตกต่างจากการกำหนดค่าเกณฑ์มาตรฐานที่สร้างสถิติ
อย่างไรก็ตาม Artificial Analysis ซึ่งเป็นองค์กรเปรียบเทียบมาตรฐานอิสระได้บันทึกผลลัพธ์ว่าเป็น Gemma 4 31B ที่เร็วที่สุดเท่าที่เคยมีมาในบริบทดังกล่าว และการกล่าวอ้างที่สำคัญที่ว่าซิลิคอนที่สร้างขึ้นตามวัตถุประสงค์สามารถเร่งขั้นตอนการถอดรหัสของการอนุมานได้อย่างมาก ซึ่งสอดคล้องกับวิธีที่อุตสาหกรรมได้รับการออกแบบสถาปัตยกรรมใหม่สำหรับปริมาณงานเอเจนต์
การยอมรับระบบคลาวด์เริ่มต้นขึ้น
Nebius ซึ่งเป็นระบบคลาวด์ AI ที่มีสำนักงานใหญ่ในอัมสเตอร์ดัม เป็นผู้ให้บริการรายแรกที่ตกลงที่จะปรับใช้ Groq 3 LPX โดยวางแผนที่จะนำมันเข้าสู่ Nebius Token Factory ซึ่งเป็นแพลตฟอร์มการอนุมานการผลิต
“เจนเนอเรชันเป็นขั้นตอนของการอนุมานที่กำหนดว่าระบบ AI ตอบสนองจริงแค่ไหน และนั่นคือสิ่งที่ NVIDIA Groq 3 LPX สร้างขึ้นเพื่อเร่งความเร็ว” Danila Shtan ประธานเจ้าหน้าที่ฝ่ายเทคโนโลยีของ Nebius กล่าว “ในฐานะที่เป็นคลาวด์ AI แรกที่นำมันมาสู่การผลิตผ่าน Nebius Token Factory เรากำลังทำให้แน่ใจว่าทุกขั้นตอนของลูปของตัวแทนให้ความรู้สึกได้ทันที — ผ่านนักพัฒนา API เดียวกันที่ใช้งานอยู่แล้ว โดยไม่มีการโยกย้ายไปยังสแต็กใหม่”
ผู้ให้บริการการอนุมาน Groq ซึ่งปัจจุบันเป็นส่วนหนึ่งของตระกูล Nvidia วางแผนที่จะเป็นหนึ่งในกลุ่มผู้ใช้รายแรกสุดของแพลตฟอร์ม
ภาพใหญ่กว่า
การประกาศการผลิตเต็มรูปแบบเป็นการส่งสัญญาณว่าตลาดโครงสร้างพื้นฐาน AI ได้เปลี่ยนแปลงไปอย่างรวดเร็วตั้งแต่การฝึกอบรมไปจนถึงการอนุมาน ในขณะที่องค์กรต่างๆ เปลี่ยนงบประมาณจากแบบจำลองดิบก่อนการฝึกอบรมไปสู่การให้เหตุผลแบบเรียลไทม์และการจัดการตัวแทนอัตโนมัติ เศรษฐศาสตร์ของโทเค็นซึ่งสามารถสร้างได้เร็วแค่ไหนและต้นทุนพลังงานเท่าใด ได้กลายเป็นสมรภูมิการแข่งขันที่เป็นศูนย์กลาง
สำหรับ Nvidia นั้น Groq 3 LPX ขยายการป้องกันแฟรนไชส์โรงงาน AI ในขณะที่ซิลิคอนแบบกำหนดเองจากผู้ให้บริการคลาวด์และสตาร์ทอัพกำลังไล่ตามปริมาณงานการอนุมานแบบเอเจนต์เดียวกัน ชั้นวางที่จะออนไลน์ในปีนี้ ตามที่ CNBC รายงาน จะทำให้ระบบการผลิตแรกอยู่ในมือลูกค้าหลายเดือนหลังจากการปิดกิจการ ซึ่งเป็นการบูรณาการอย่างรวดเร็วตามมาตรฐานอุตสาหกรรมเซมิคอนดักเตอร์
บริษัทไม่ได้เปิดเผยราคาสำหรับระบบใหม่ Groq 3 LPX จะถูกนำเสนอตามเวลาและถ้ามีให้บริการผ่านพันธมิตรคลาวด์ AI โดย Nebius คาดว่าจะเป็นคนแรกที่เสนอการเข้าถึงให้กับนักพัฒนาผ่านจุดสิ้นสุด API ที่มีอยู่
---
ก้าวนำหน้า AIรับข่าวสาร AI การวิเคราะห์ และความก้าวหน้าล่าสุด ทั้งหมดในที่เดียว
อ่านข่าว AI เพิ่มเติม →