Meta ได้ดึงม่าน MTIA 400 ออกมา ซึ่งเป็นตัวเร่งความเร็วแบบกำหนดเองตัวแรกที่มุ่งเป้าไปที่การฝึกโมเดลภาษาขนาดใหญ่ — โดยมีจุดหักมุมที่ไม่ธรรมดา ชิปซึ่งมีรายละเอียดในการประชุมเซมิคอนดักเตอร์ Hot Chips ประจำปีในสัปดาห์นี้ จะนำภาระงานของผู้แนะนำการเรียนรู้เชิงลึกที่ให้บริการโฆษณาที่ให้ทุนสนับสนุนความทะเยอทะยาน AI ทั้งหมดของ Meta
The Register ซึ่งรายงานการเปิดเผยข้อมูลทางเทคนิคทั้งหมดเป็นครั้งแรก เรียกการออกแบบนี้ว่า "บุคลิกภาพที่แตกแยก" โดยด้านหนึ่งมีชิปฝึกอบรมระดับแนวหน้า และอีกด้านหนึ่งเป็นกลไกแสดงโฆษณา มันเป็นสัญญาณที่ชัดเจนที่สุดว่า Meta ตั้งใจที่จะขับเคลื่อนอนาคต AI ด้วยซิลิคอนของตัวเอง หากต้องการข้อมูลเพิ่มเติมเกี่ยวกับ การพัฒนา AI ล่าสุด ที่กำลังกำหนดรูปแบบอุตสาหกรรมชิป โปรดติดตาม AI Buzz Wire
ทำไมต้องฝึก AI และแสดงโฆษณาบนชิปตัวเดียวกัน
บริษัทส่วนใหญ่ที่สร้างตัวเร่งความเร็ว AI แบบกำหนดเองเริ่มต้นด้วยการอนุมาน คลัสเตอร์มีขนาดเล็กลง ชิปง่ายกว่า และเข้าใจงานได้ดี Meta กำลังขัดขวางแนวโน้มดังกล่าวโดยกำหนดเป้าหมายไปที่การฝึกอบรม LLM ก่อน ซึ่งเป็นปริมาณงานที่ต้องใช้การประมวลผลมากที่สุดในอุตสาหกรรม ซึ่งมักจะต้องใช้ตัวเร่งความเร็วหลายหมื่นหรือหลายแสนตัว
การประนีประนอมเป็นภาระงานที่สอง การอนุมาน DLRM ซึ่งเป็นโมเดลผู้แนะนำการเรียนรู้เชิงลึกที่ตัดสินใจว่าโฆษณาและโพสต์ใดที่ผู้ใช้เห็น ส่วนใหญ่จะผูกกับหน่วยความจำมากกว่าผูกกับการประมวลผล ซึ่งหมายความว่าอำนาจการยิงในการฝึกอบรมของชิปส่วนใหญ่ไม่ได้ใช้งานระหว่างการแสดงโฆษณา แต่การที่ Meta เผาผลาญเงินหลายหมื่นล้านดอลลาร์ในการคำนวณ การดึงชิปตัวเดียวเป็นหน้าที่สองเท่าถือเป็นการป้องกันความเสี่ยงในทางปฏิบัติ โดยเฉพาะอย่างยิ่งเมื่อกรณีการใช้งานหนึ่งในสองกรณีสร้างรายได้โดยตรง
ข้อมูลภายใน MTIA 400: ชิปเล็ต 3 นาโนเมตร และ Broadcom IP
ตามการนำเสนอ Hot Chips ของ Meta ซึ่งวิเคราะห์โดย The Register และ ServeTheHome:
- สถาปัตยกรรมแบบมัลติ-ไดย์: ไดย์ประมวลผลสองตัว, I/O สองตัวและการเชื่อมต่อโฮสต์ SoC ดายและการจัดการเวิร์กโหลด
- โหนดกระบวนการ: ชิปประมวลผลสร้างขึ้นจากเทคโนโลยีการผลิต 3 นาโนเมตร ซึ่งสันนิษฐานว่ามาจาก TSMC
- การประมวลผล: องค์ประกอบการประมวลผลตาราง 6x8 ต่อชิปเล็ต ให้การประมวลผล MXFP4 รวม 12 petaFLOPS ที่ 1.7 GHz
- หน่วยความจำ: สแต็ก HBM3e ขนาด 36 GB แปดสแต็ก — รวม 288 GB พร้อมแบนด์วิดท์ประมาณ 9.2 TB/s
- การเชื่อมต่อถึงกัน: แบนด์วิดท์แบบชิปต่อชิป 1.2 TB/s ผ่าน RDMA ซึ่งมีแนวโน้มว่าจะเป็นอีเธอร์เน็ตเนื่องจาก Broadcom มีส่วนเกี่ยวข้อง
ลายนิ้วมือของ Broadcom มีอยู่ทั่วไป Register ตั้งข้อสังเกตว่าตัวเร่งความเร็วนั้นเกือบจะสร้างขึ้นอย่างแน่นอนโดยใช้ XPU IP ของนักออกแบบชิป ซึ่งเป็นทางเลือกเชิงปฏิบัติที่ช่วยให้ Meta มุ่งเน้นไปที่การสร้างความแตกต่างในขณะที่จ้างภายนอกส่วนที่ไม่สวยงามของการออกแบบตัวเร่งความเร็ว
เทียบกับ Nvidia และ AMD ได้อย่างไร
ภาพการแสดงมีความเหมาะสมยิ่ง ด้วยความแม่นยำที่สูงกว่าที่ใช้กันทั่วไปในการฝึกอบรม MTIA 400 นั้นเร็วกว่าเครื่องเร่งความเร็ว Blackwell รุ่นท็อปของ Nvidia ประมาณ 20% ในขณะที่ดึงพลังงานที่ใกล้เคียงกัน แบนด์วิดธ์หน่วยความจำดีกว่าชิ้นส่วนรุ่นก่อนหน้าของ Nvidia และ AMD ประมาณ 15%
แต่เมื่อเทียบกับรุ่นใหม่ล่าสุด ช่องว่างก็กว้างขึ้นอย่างรวดเร็ว: MTIA 400 ช้ากว่า Rubin ของ Nvidia และ Instinct MI455X ของ AMD อยู่ระหว่าง 3x ถึง 3.3x ตามลำดับ และมีแบนด์วิธหน่วยความจำน้อยกว่าครึ่งหนึ่งของ GPU ใหม่เหล่านั้น การขาดดุลนั้นเป็นเหตุผลว่าทำไม Meta จึงวางตำแหน่งชิ้นส่วนดังกล่าวเป็นชิปฝึกหัดแทนที่จะเป็นชิปอนุมาน — สำหรับการให้บริการโทเค็น มันมีตัวเลือกที่เร็วกว่ามาก
ในระดับระบบ มีความคล้ายคลึงกับชั้นวางมาตรฐานอุตสาหกรรมเป็นอย่างมาก เบลดประมวลผลแต่ละอันจะจับคู่ตัวเร่งความเร็ว MTIA 400 สี่ตัวกับสวิตช์ PCIe, CPU x86 และ NIC แบบขยายขนาด แร็คแบบเต็มมีเบลดประมวลผล 18 ตัวและสวิตช์เบลดแปดตัว — ตัวเร่งความเร็ว 72 ตัวในโดเมนเดียว การกำหนดค่าที่สะท้อนการออกแบบแร็ค NVL72 ของ Nvidia และ Helios ของ AMD สไลด์ของ Meta สัญญาว่าจะ "ปรับขนาดตัวเร่งความเร็วหลายพัน" โดยไม่ต้องระบุเพดานของคลัสเตอร์
แผนการทำงาน: MTIA 450 ปีหน้า
MTIA 400 ไม่ใช่จุดสิ้นสุดของบรรทัด Meta เปิดเผยในเดือนมีนาคมว่ามีแผนจะเปิดตัว MTIA รุ่นใหม่สี่รุ่นเป็นเวลาหกเดือน และจุดต่อไปคือ MTIA 450 ซึ่งเป็นตัวแปรที่ได้รับการเพิ่มประสิทธิภาพการอนุมาน ซึ่งคาดว่าจะเพิ่มแบนด์วิดท์หน่วยความจำเป็นสองเท่า โดยสันนิษฐานว่าใช้ HBM4 ชิปดังกล่าวมีกำหนดการผลิตในปีหน้า และน่าจะเหมาะสมอย่างยิ่งกับการใช้งานปริมาณงานการแนะนำแบบ LLM
แม้จะมีความคืบหน้า แต่การวิเคราะห์ของ Register ก็ตรงไปตรงมา: ซิลิคอนภายในของ Meta จะไม่เข้ามาแทนที่ AMD หรือ Nvidia GPU ในเร็วๆ นี้ Meta Superintelligence Labs เกือบจะแน่นอนว่ายังคงฝึกอบรมโมเดลระดับแนวหน้าบน GPU ทั่วไป และฮาร์ดแวร์เฉพาะแอปพลิเคชันยังคงเหมาะสมที่สุดสำหรับปริมาณงานที่เสถียรและเป็นที่เข้าใจกันดี
ทำไมมันถึงสำคัญ
MTIA 400 มีความสำคัญด้วยเหตุผลสองประการ ประการแรก มันแสดงให้เห็นว่าไฮเปอร์สเกลเลอร์เต็มใจที่จะโจมตีปริมาณงานที่ยากที่สุด — การฝึกอบรมชายแดน — แทนที่จะเลือกชัยชนะจากการอนุมานง่ายๆ ประการที่สอง ด้านการแสดงโฆษณาของการออกแบบเป็นสิ่งเตือนใจถึงเศรษฐศาสตร์: รายจ่ายฝ่ายทุนทุกดอลลาร์สำหรับซิลิคอนสั่งทำพิเศษได้รับการรับประกันโดยธุรกิจโฆษณาที่ทำกำไรได้มากที่สุดในประวัติศาสตร์ หาก Meta สามารถเปลี่ยนปริมาณงานการฝึกอบรมและการแนะนำออกจาก GPU ของผู้ค้าได้แม้แต่เศษเสี้ยว การประหยัดในระดับนั้นจะถูกวัดเป็นพันล้าน
แหล่งที่มา: การนำเสนอ Meta's Hot Chips 2026, The Register และ ServeTheHome
---
ก้าวนำหน้า AIรับข่าวสาร AI การวิเคราะห์ และความก้าวหน้าล่าสุด ทั้งหมดในที่เดียว
อ่านข่าว AI เพิ่มเติม →