Intel เปิดการประชุม Hot Chips ในปีนี้โดยเจาะลึกเข้าไปใน Crescent Island ซึ่งเป็น GPU สำหรับศูนย์ข้อมูลที่กำลังวางเดิมพันสำหรับเวิร์กโหลด AI ในระยะต่อไป: การอนุมานแบบเอเจนต์ นำเสนอโดยหัวหน้าสถาปนิกระบบ AI ขององค์กร Sumit Mohan และ Intel Fellow Hong Jiang การพูดคุยมีศูนย์กลางอยู่ที่สามตัวชี้วัดที่บริษัทกล่าวว่ากำหนดยุคเอเจนต์ - โทเค็นต่อวัตต์ ความจุหน่วยความจำขนาดใหญ่ และสแต็กซอฟต์แวร์แบบเปิด
เวลามีความสำคัญ Nvidia ใช้การประชุมเดียวกันเพื่อดูรายละเอียดเกี่ยวกับระบบแร็คสเกล Vera Rubin NVL72 และผู้จำหน่ายเครื่องเร่งความเร็วทุกรายที่ Hot Chips 2026 ต่างก็นำเสนอประสิทธิภาพมากกว่าประสิทธิภาพสูงสุดแบบดิบๆ คำตอบของ Intel เป็นส่วนหนึ่งที่แลกเปลี่ยนเทคโนโลยีหน่วยความจำ AI GPU กระแสหลักที่ใช้กับสิ่งที่ถูกกว่าต่อกิกะไบต์ และทำให้มีหัวข้อข่าวที่โดดเด่น For more context on this story, see our ongoing AI news.
การ์ด PCIe 480GB ที่ 350 วัตต์
Crescent Island เป็น GPU PCIe ขนาด 350 วัตต์ ระบายความร้อนด้วยอากาศ การ์ดที่มีตราสินค้าของ Intel มาพร้อมกับหน่วยความจำ LPDDR5X ขนาด 160GB แต่การออกแบบดังกล่าวทำให้พันธมิตร ODM สามารถสร้างเวอร์ชันที่มีความจุสูงสุด 480GB บนบอร์ด - ประมาณสามเท่าของความจุของการ์ดเร่งความเร็วระดับไฮเอนด์ทั่วไป และเพียงพอที่จะเก็บ KV-caches ที่มีขนาดใหญ่มากไว้สำหรับเวิร์กโหลดเอเจนต์บริบทยาวและหลายเซสชัน การออกแบบครอบคลุมประเภทข้อมูลจาก FP4 และ MXFP4 จนถึง FP64
ตัวเลือกหน่วยความจำคือการตัดสินใจเชิงกลยุทธ์ในผลิตภัณฑ์ LPDDR5X แลกเปลี่ยนแบนด์วิดท์กับความจุและต้นทุน ซึ่งเหมาะกับโปรไฟล์ปริมาณงานการอนุมาน โดยที่หน้าต่างบริบทขนาดใหญ่และลูปการเรียกใช้เครื่องมือใช้ความจุของหน่วยความจำมากกว่าการประมวลผลดิบ Intel วางกรอบการออกแบบทั้งหมดไว้ที่ "โทเค็นต่อวัตต์" - ให้เอาต์พุตที่มีประโยชน์ต่อหน่วยพลังงานมากกว่าที่จะชนะการเปรียบเทียบสูงสุด-FLOPS
Xe3P Silicon: 32 คอร์, 256 XMX Engine
ภายใต้ฝากระโปรง Crescent Island คือสถาปัตยกรรม Xe3P ของ Intel และ Intel นำเสนอเป็นการก้าวกระโดดเหนือรุ่น Xe2 ที่ใช้ Battlemage โดยที่ Xe2 นำเสนอ Xe core 20 คอร์และอาร์เรย์ XMX ซิสโตลิก 4 ดีพ Crescent Island นำเสนอ Xe คอร์ 32 คอร์และอาร์เรย์ซิสโตลิก 16 ดีป ซึ่งป้อนเครื่องยนต์ XMX ได้ทั้งหมด 256 เครื่อง
Xe Matrix Extensions รุ่นที่สามเพิ่มการออกแบบเมทริกซ์ Xe แบบขยายสามทางพร้อมปัญหาร่วมที่มีความแม่นยำของ FP4 และการรองรับ FP64 Xe core แต่ละคอร์มีไฟล์รีจิสเตอร์ทั่วไปขนาด 1MB และแคช L1 ขนาด 512KB โดยมี L2 แบบรวมขนาด 32MB ที่ใช้ร่วมกันทั่วทั้งอุปกรณ์ มีเดียเอ็นจิ้นที่มีตัวถอดรหัสสี่ตัวและตัวเข้ารหัสสี่ตัววางอยู่ข้างๆ และ SoC ทั้งหมดเชื่อมต่อผ่าน PCIe Gen5 x16 พร้อมการรองรับการขยายขนาดทั่วทั้งแฟบริคสวิตช์แบบเปิด Intel แสดงรายการพลังงานที่ไม่ได้ใช้งานแบบแอ็คทีฟที่ 50 วัตต์หรือน้อยกว่าในสถานะ G0 และประมาณ 10 วัตต์ในสถานะ G8 พลังงานต่ำ ซึ่งทำได้ผ่านโดเมนพลังงานแบบกระจาย เราเตอร์เครือข่ายบนชิปแบบแพ็กเก็ตที่มีสัญญาณนาฬิกาแบบก้าวร้าว และราง DVFS อิสระสำหรับกราฟิกและสื่อ
คุณสมบัติ RAS ที่ยืมมาจาก Playbook ของเซิร์ฟเวอร์
สำหรับส่วนของศูนย์ข้อมูล วิศวกรรมความน่าเชื่อถือมีเวลาพอๆ กับปริมาณงาน ซึ่งเป็นธีมที่ Nvidia เลือกใช้ Vera Rubin เช่นกัน Crescent Island นำเสนอ ECC และความเท่าเทียมกันในโครงสร้างหน่วยความจำหลัก การตรวจสอบข้อผิดพลาดในทุก ๆ ฮอปของแฟบริคที่เชื่อมต่อภายใน การออฟไลน์เพจแบบไดนามิก การซ่อมแซมหลังแพ็คเกจแบบฮาร์ด และการรายงานข้อผิดพลาดขั้นสูงของ PCI Express Intel กล่าวว่าการรวมกันนี้ช่วยลดความเสียหายของข้อมูลแบบเงียบ ซึ่งเป็นโหมดความล้มเหลวที่สำคัญที่สุดสำหรับการอนุมานแบบอัตโนมัติที่ใช้เวลานาน
นอกจากนี้ Intel ยังวางตำแหน่งส่วนหนึ่งไว้ในพอร์ตโฟลิโอที่ขยายตั้งแต่ GPU เวิร์กสเตชัน Arc Pro ไปจนถึง SambaNova SN50 RDU ที่ได้มา โดยมี Crescent Island เป็นจุดยึดศูนย์ข้อมูลระดับองค์กรที่ด้านบน บริษัทได้แสดงแผนการทำงานที่สืบทอดมายาวนานกว่าหกปี โดยคัดเลือก GPU ให้เป็นการออกแบบรุ่นที่สามที่เป็นผู้ใหญ่มากกว่าความพยายามครั้งแรก การ์ดดังกล่าวเปิดตัวครั้งแรกที่งาน Computex ในเดือนมิถุนายน Hot Chips นำเสนอรายละเอียดทางสถาปัตยกรรมเบื้องหลัง
เหตุใดการอนุมานแบบตัวแทนจึงสนับสนุนการออกแบบนี้
ข้อโต้แย้งเกี่ยวกับปริมาณงานเป็นส่วนที่น่าสนใจที่สุดในการนำเสนอของ Intel AI ตัวแทน - แบบจำลองที่เรียกใช้เครื่องมือลูกโซ่ เปิดบริบทที่ยาวไว้ และประสานงานระหว่าง CPU และ GPU - ภาษีเวลาแฝง ความจุหน่วยความจำ และปริมาณงานของระบบพร้อมกัน แทนที่จะเป็นโปรไฟล์ปริมาณงานเป็นชุดของการให้บริการแชทบอท ความจุแคช KV สำหรับบริบทที่ยาวและเซสชันที่เกิดขึ้นพร้อมกันของโดเมนที่บีบอัดนั้นถูกสร้างขึ้นในการออกแบบ SoC อย่างชัดเจน
เฟรมดังกล่าวยังอธิบายการเดิมพัน LPDDR5X อีกด้วย หากคลื่นลูกใหม่ของการประมวลผล AI คือเอเจนต์ที่ต้องใช้หน่วยความจำมากกว่าการรันการฝึกอบรม การ์ดขนาด 480GB ที่ 350 วัตต์เป็นทางเลือกที่น่าเชื่อถือแทนชิ้นส่วนที่ใช้ HBM ระดับพรีเมียม โดยที่ชุดซอฟต์แวร์จะส่งมอบ การเน้นย้ำของ Intel ในด้าน open stack และ open switch fabric มุ่งเป้าไปที่ผู้ซื้อที่ระมัดระวังการล็อคอินแพลตฟอร์มแบบรวมของ Nvidia
Crescent Island จะไม่แทนที่ตัวเร่งการฝึกอบรมที่ครอบงำพาดหัวข่าว AI และ Intel ไม่ได้เปิดเผยราคาหรือความพร้อมในการประชุม แต่จากการที่ Intel คิดว่าการอนุมานดำเนินไปในทิศทางใด - หน่วยความจำขนาดใหญ่, พลังงานน้อย, โครงสร้างแบบเปิด - นี่เป็นหนึ่งในเรื่องราวทางสถาปัตยกรรมที่ชัดเจนยิ่งขึ้นของ Hot Chips ประจำปีนี้
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →