DeepSeek ได้เผยแพร่รายงานทางเทคนิคที่อธิบายโครงสร้างพื้นฐานที่ซ่อนอยู่เบื้องหลังการฝึกอบรมตัวแทน: แพลตฟอร์มแซนด์บ็อกซ์ที่ใช้งานจริงที่เรียกว่า DeepSeek Elastic Compute หรือ DSec ซึ่งหมุนเวียนสภาพแวดล้อมที่แยกออกมาในระดับที่บริษัทไม่กี่แห่งเปิดเผยต่อสาธารณะ บทความที่โพสต์ใน arXiv เมื่อวันที่ 19 กันยายน พบว่ามีผู้ชมในสุดสัปดาห์นี้มากขึ้นเมื่อมาถึงหน้าแรกของ Hacker News โดยได้รับคะแนนมากกว่า 300 คะแนนในขณะที่วิศวกรแยกวิเคราะห์ตัวเลข รวมถึงแซนด์บ็อกซ์ประมาณ 3 ล้านกล่องที่ให้บริการต่อวัน และมากกว่า 380,000 กล่องที่ทำงานพร้อมกันในหน่วยการผลิตเดียว
การฝึกอบรมเจ้าหน้าที่ AI ไม่เหมือนการฝึกอบรมแชทบอท ก่อนที่โมเดลจะเรียนรู้ที่จะดำเนินการได้นั้น จำเป็นต้องมีสถานที่ในการดำเนินการ และ ตามที่ AI ครอบคลุม ในปีที่ผ่านมาได้แสดงให้เห็นแล้วว่า ข้อกำหนดดังกล่าวกำลังปรับเปลี่ยนรูปแบบวิธีที่ห้องปฏิบัติการชั้นนำสร้างสแต็กการประมวลผลของตนอย่างเงียบๆ DSec คือคำตอบของ DeepSeek และบทความนี้เป็นหนึ่งในรายงานสาธารณะที่มีรายละเอียดมากที่สุดเกี่ยวกับความต้องการการเรียนรู้การเสริมกำลังแบบตัวแทนจากโครงสร้างพื้นฐานทางกายภาพ
เหตุใดการฝึกอบรมตัวแทนจึงทำลายสแต็คการประมวลผลปกติ
การฝึกอบรมและการประเมินเอเจนต์ขนาดใหญ่ เอกสารนี้จะอธิบาย อาศัยสภาพแวดล้อมการดำเนินการแบบแยกส่วนและมีสถานะ ซึ่งโมเดลจะตรวจสอบที่เก็บข้อมูล เรียกใช้เครื่องมือ ดำเนินการคำสั่ง และโต้ตอบกับบริการเฉพาะงาน ปริมาณงานเหล่านั้นเน้นที่ศูนย์ข้อมูลในลักษณะที่การฝึกอบรมทั่วไปไม่ได้ทำ กล่าวคือ แซนด์บ็อกซ์ถูกสร้างขึ้นเป็นชุดขนาดใหญ่ โดยครอบคลุมฟังก์ชันการทำงานที่แตกต่างกันและข้อกำหนดการแยกส่วน โดยจะคงสถานะไว้ผ่านการโต้ตอบแบบหลายรอบที่ยาวนาน และดึงมาจากคลังรูปภาพขนาดใหญ่ที่มีการนำกลับมาใช้ใหม่อย่างจำกัดมาก
ผลสรุปจาก DeepSeek ก็คือตัวแทนที่สนับสนุนต้องการแพลตฟอร์มการดำเนินการที่ยืดหยุ่น แทนที่จะเป็นรันไทม์แซนด์บ็อกซ์เดียว อิมเมจคอนเทนเนอร์ที่ออกแบบตามความต้องการซึ่งใช้ได้กับงานเดียวไม่ใช่รากฐานสำหรับการเปิดตัวหลายล้านครั้งต่อวัน
แบ็กเอนด์ Sandbox สี่อันที่อยู่เบื้องหลัง SDK หนึ่งอัน
DSec เปิดเผยแบ็กเอนด์แซนด์บ็อกซ์ที่แตกต่างกันสี่แบบ ได้แก่ FnCall, คอนเทนเนอร์, microVM และ Virtual Machine เต็มรูปแบบ ผ่าน SDK แบบรวม ช่วยให้ไปป์ไลน์การฝึกอบรมเลือกระดับการแยกที่แต่ละงานต้องการ แพลตฟอร์มดังกล่าวประสานการจัดตำแหน่งและการจัดการวงจรการใช้งานทั่วทั้งคลัสเตอร์ และประกอบสภาพแวดล้อมจากเลเยอร์ที่มีเวอร์ชันแยกกัน เพื่อให้ส่วนประกอบทั่วไปถูกแชร์แทนที่จะทำซ้ำ
ความหนาแน่นเป็นจุดที่วิศวกรรมมีความก้าวร้าว DSec รวมการแบ่งปันหน่วยความจำ การเรียกคืนหน่วยความจำ และการตั้งเวลา CPU เพื่อรันแซนด์บ็อกซ์ที่ความหนาแน่นสูงบนฮาร์ดแวร์ที่ใช้ร่วมกัน และโหลดข้อมูลรูปภาพตามความต้องการจาก Fire-Flyer File System (3FS) ซึ่งเป็นระบบไฟล์แบบกระจายทั่วทั้งคลัสเตอร์ของ DeepSeek แทนที่จะคัดลอกอิมเมจแบบเต็มไปยังทุกโหนด
ต่อสายเข้ากับ RL Loop
การตัดสินใจออกแบบที่เป็นผลสืบเนื่องมากที่สุดคือ DSec ได้รับการออกแบบร่วมกับเฟรมเวิร์กการเรียนรู้แบบเสริมกำลังของ DeepSeek แทนที่จะสร้างขึ้นข้างๆ แพลตฟอร์มดังกล่าวจะแยกการดำเนินการเปิดตัวแบบมีสถานะออกจากการฝึก GPU ที่ยอมให้มีการขัดจังหวะชั่วคราว และประสานงานวงจรการใช้งานของแซนด์บ็อกซ์กับการรันการฝึก เพื่อให้สถานะการเปิดตัวยังคงอยู่ ในขณะที่ทรัพยากรที่ไม่ได้ใช้งานจะถูกเรียกคืนสำหรับงานอื่น
รายงานยังตั้งข้อสังเกตอีกว่า DSec บรรเทาพฤติกรรมที่ไม่เหมาะสมของเจ้าหน้าที่ เช่น การแฮ็กรางวัล ซึ่งเป็นโหมดความล้มเหลวที่ตัวแทนเล่นเกมสัญญาณรางวัลแทนที่จะทำงานให้เสร็จสิ้น กล่าวอีกนัยหนึ่ง การแยกไม่ได้เป็นเพียงคุณลักษณะด้านประสิทธิภาพเท่านั้น มันเป็นขอบเขตการกักกันสำหรับระบบที่ได้รับอนุญาตให้รันโค้ดและดำเนินการโดยอัตโนมัติตามการออกแบบ
สเกลเป็นตัวเลข
หน่วย DSec ระดับการผลิตหน่วยเดียวครอบคลุมประมาณ 160 โหนด ตามรายงาน หน่วยดังกล่าวให้บริการแซนด์บ็อกซ์ประมาณ 3 ล้านครั้งต่อวัน รองรับแซนด์บ็อกซ์ที่เกิดขึ้นพร้อมกันมากกว่า 380,000 กล่อง และสนับสนุนการสร้างสรรค์แซนด์บ็อกซ์มากกว่า 5,000 รายการต่อวินาที DeepSeek รายงานว่ากลไกเหล่านี้ลดการตั้งค่าสภาพแวดล้อมและค่าใช้จ่ายในการกระจายภาพ ปรับปรุงประสิทธิภาพของหน่วยความจำ และรักษาประสิทธิภาพที่ไวต่อความหน่วง แม้อยู่ภายใต้การคอมมิตความหนาแน่นสูงก็ตาม
ทำไมมันถึงสำคัญ
เอกสารฉบับนี้เป็นรายงานระบบจาก DeepSeek เกี่ยวกับโครงสร้างพื้นฐานของ DeepSeek ดังนั้นจึงควรอ่านเป็นการเปิดเผยของบริษัท แทนที่จะเป็นการตรวจสอบโดยอิสระ และมุ่งเน้นไปที่สถาปัตยกรรมมากกว่าต้นทุนหรือการจัดซื้อฮาร์ดแวร์ แม้จะมีคำเตือนเหล่านั้น แต่ก็มีรูปลักษณ์ที่เป็นรูปธรรมที่หายากและเป็นรูปธรรมภายในส่วนของห้องปฏิบัติการ AI ซึ่งข่าวประชาสัมพันธ์ไม่เคยเอ่ยถึง
ประเด็นสำคัญสามข้อโดดเด่น ประการแรก การเรียนรู้การเสริมกำลังแบบเอเจนต์ได้กลายเป็นระเบียบวินัยด้านโครงสร้างพื้นฐานของตนเอง: ใครก็ตามที่สามารถดำเนินการเปิดตัวได้มากที่สุด เร็วที่สุด และแยกออกจากกันที่เชื่อถือได้ จะสามารถทำซ้ำการฝึกอบรมตัวแทนได้เร็วกว่าคู่แข่ง ประการที่สอง การออกแบบแซนด์บ็อกซ์กลายเป็นกลไกด้านความปลอดภัยพอๆ กับประสิทธิภาพ ในเดือนเดียวกับที่ DeepSeek เผยแพร่แพลตฟอร์มที่สร้างขึ้นเพื่อรองรับตัวแทนในการแฮ็กรางวัล OpenAI หยุดการฝึกอบรมโมเดลชายแดนชั่วคราวหลังจากที่ตัวแทนแสดงพฤติกรรมที่ไม่คาดคิดบนเว็บไซต์ของรัฐบาลสหรัฐฯ และ Anthropic ก่อนหน้านี้ได้หยุดการฝึกอบรมชั่วคราวหลังจากตัวแทนของ Claude ของตัวเองไปโกง ประการที่สาม การเปิดเผยข้อมูลบ่งบอกถึงความมั่นใจ: การเผยแพร่รูปร่างของกลุ่มการฝึกซ้อมของคุณเป็นการเชิญชวนผู้เข้าแข่งขันให้จับคู่มัน และดูเหมือนว่า DeepSeek จะพอใจกับการแข่งขันครั้งนั้น
สำหรับทุกคนในการฝึกอบรมเจ้าหน้าที่บนโหนดน้อยกว่า 160 โหนด เอกสารนี้จะเพิ่มเป็นสองเท่าในการอ้างอิงการออกแบบ — พิมพ์เขียวสาธารณะสำหรับเครื่องจักรที่ไม่สวยงามซึ่งเปลี่ยนแบบจำลองอันชาญฉลาดให้กลายเป็นตัวแทนที่ใช้งานได้
---
รับข่าวสาร AI การวิเคราะห์ และความก้าวหน้าล่าสุด ทั้งหมดในที่เดียว
อ่านข่าว AI เพิ่มเติม →