สร้างมาให้อ่าน ไม่ใช่แค่รัน
ตามที่ MarkTechPost รายงาน Molt วัดค่า 8.6K บรรทัดของโค้ด RL โดยประมาณ โดยนับโดยการติดตามกราฟนำเข้าจากจุดเข้า RL ของแต่ละเฟรมเวิร์ก วิธีการเดียวกันนี้นับได้ประมาณ 62,000 บรรทัดสำหรับ verl, 25K สำหรับสไลม์ และ 7.2K สำหรับ OpenRLHF ความกะทัดรัดโดยเจตนานั้นเป็นหัวใจสำคัญของโครงการ: การวิจัย RL แบบเอเจนต์เป็นการปรับเปลี่ยนอัลกอริธึมอย่างต่อเนื่อง — ตัวประมาณค่าใหม่ ขั้นตอนไปป์ไลน์ใหม่ แผนการเปิดตัวใหม่ — และในเฟรมเวิร์กกระแสหลัก ทุกเธรดการเปลี่ยนแปลงผ่านเลเยอร์ของเทรนเนอร์ แบ็กเอนด์แบบกระจาย และกาวการเปิดตัว มอลต์ตั้งเป้าที่จะขจัดแรงเสียดทานนั้น
เฟรมเวิร์กนี้ ได้รับอนุญาตจาก Apache 2.0 และมาพร้อมกับโค้ดเรียกใช้งาน สคริปต์ Slurm และคอนเทนเนอร์ที่สร้างไว้ล่วงหน้า อย่างไรก็ตาม NVIDIA แสดงให้เห็นชัดเจนว่ารายงานการวิจัยที่ให้มาวางตำแหน่ง Molt ให้เป็นโครงสร้างพื้นฐานด้านการวิจัย มากกว่าที่จะเป็นบริการฝึกอบรมด้านการผลิต และฮาร์ดแวร์คือผู้ดูแลประตูที่แท้จริง สูตรที่จัดส่งจะถือว่า 2 โหนดจาก 8 H100 GPU แยก 8 โหนดสำหรับการฝึก และ 8 โหนดสำหรับการเปิดตัว ซึ่งทำให้เข้าถึงได้จากห้องปฏิบัติการชายแดนและที่อยู่ติดกัน สตาร์ทอัพที่ได้รับทุนสนับสนุนหลังการฝึกอบรม กลุ่มวิจัย AI ระดับองค์กร และกลุ่มวิชาการที่มีการเข้าถึง H100 หรือ H200 แบบหลายโหนด
เรียบเรียงไม่แยกส่วน
สถาปัตยกรรมของ Molt ประกอบด้วยเครื่องมือสามชิ้นที่มีอยู่โดยไม่ต้องแยกส่วนใดๆ เลย ดังนั้นการปรับปรุงต้นทางจึงมาถึงในฐานะหมุดคอนเทนเนอร์แทนที่จะเป็นการรีเบสที่เจ็บปวด โดยจะใช้ Ray สำหรับการจัดวางและคิวแบบอะซิงโครนัส vLLM สำหรับการเปิดตัว และ NVIDIA AutoModel พร้อม FSDP2 สำหรับการฝึก รันไทม์ประกอบด้วยกลุ่มตัวแทน ชุดของกลไก vLLM ที่อยู่หลังเราเตอร์คำขอ และผู้ดำเนินการด้านนโยบายที่สามารถฝึกอบรมได้เพียงคนเดียว พูลสตรีมมิ่งช่วยให้กลุ่มพร้อมท์บินอยู่เสมอ ดังนั้นเครื่องยนต์จะไม่ระบายออกในขณะที่นักแสดงฝึกซ้อม
คุณลักษณะที่เรียกว่า การเปิดตัวบางส่วน เป็นศูนย์กลางของประสิทธิภาพ เมื่อนโยบายอัปเดต Molt จะหยุดกลไกชั่วคราว ออกอากาศส่วนแบ่งที่อัปเดตของนักแสดงผ่าน NCCL ไปยังแต่ละกลไกโดยตรง และดำเนินการคำขอที่เก็บไว้ต่อแทนที่จะละทิ้ง เพื่อหลีกเลี่ยงรูปแบบที่สิ้นเปลืองของการทิ้งการเปิดตัวที่กำลังดำเนินการทุกครั้งที่มีการเปลี่ยนแปลงโมเดล
หนึ่งโมดูล สองแบบฟอร์มตัวแทน
RL ที่รันใน Molt ตั้งชื่อโมดูล Python เดียวที่ส่งออก AgentRunner และทุกสิ่งทุกอย่าง รวมถึงฟังก์ชันรางวัล ก็เป็นโค้ดธรรมดา กรอบการทำงานรองรับสองรูปแบบ ด้วย Env เฟรมเวิร์กจะเป็นเจ้าของลูป LLM ภายใน `ขั้นตอน ()` ที่จัดแนว Gymnasium ซึ่งเหมาะกับรูปแบบการเรียนรู้การเสริมกำลังที่คุ้นเคย ด้วย ChatAgent ผู้ใช้จะเป็นเจ้าของลูปผ่าน OpenAI หรือ Anthropic SDK ในสต็อก ทำให้การรวมตัวแทนที่มีอยู่เป็นเรื่องง่าย
ในการเชื่อมโยงทั้งสองอย่าง Molt เปิดตัว เซิร์ฟเวอร์ย้อนกลับ ที่พูดโปรโตคอลแบบสายทั้งสอง และทุกคำขอจะถูกถอดรหัสฝั่งเซิร์ฟเวอร์เป็นการสะสมโทเค็นที่แน่นอนเพียงอันเดียว เมื่อเอเจนต์ขอบฟ้ายาวกระชับบริบทและเขียนคำนำหน้าใหม่ — ซึ่งเป็นการดำเนินการทั่วไปสำหรับเอเจนต์ที่ทำงานหลายรอบ — เซิร์ฟเวอร์จะปิดผนึกเซ็กเมนต์ปัจจุบันและเปิดเซ็กเมนต์ใหม่โดยอัตโนมัติ นี่คือรายละเอียดระบบประปาชนิดหนึ่งที่กำหนดว่าการทำงาน RL แบบตัวแทนนั้นถูกต้องในทางปฏิบัติหรือเพียงแค่ดูถูกต้องเท่านั้น
ค่าคงที่ความถูกต้องสามค่า
การออกแบบของ Molt ได้รับการจัดระเบียบโดยใช้ค่าคงที่ความถูกต้องสามค่าที่จัดการกับความล้มเหลวเล็กน้อยของการฝึกอบรมตัวแทนแบบอะซิงโครนัส ข้อมูลประจำตัวโทเค็น หมายถึงรหัสโทเค็นตัวอย่างจะกำหนดวิถี ไม่ใช่การถอดเสียงที่แปลงโทเค็นใหม่ ซึ่งมีความสำคัญเนื่องจากการต่อข้อความกลับเข้าไปในโทเค็นสามารถเปลี่ยนข้อมูลได้อย่างเงียบๆ ซีแมนทิกส์เวอร์ชันนโยบาย ช่วยให้มั่นใจว่าโทเค็นที่ฝึกได้จะรักษาความน่าจะเป็นของบันทึกพฤติกรรม-นโยบายไว้ โดยมีการใช้งานแบบอะซิงโครนัสแก้ไขต่อโทเค็นด้านหลังเกตระดับลำดับ ความสม่ำเสมอในการส่งต่อ กำหนดให้กลไกการเปิดตัวและผู้ดำเนินการฝึกอบรมต้องเห็นด้วยกับความหมายของโมเดล
ค่าคงที่สุดท้ายนั้นสำคัญที่สุดสำหรับ นโยบายแบบผสมผสานของผู้เชี่ยวชาญ (MoE) ซึ่งเป็นเรื่องปกติมากขึ้น เราเตอร์การเปิดตัวและการฝึกอบรมจะคัดเลือกผู้เชี่ยวชาญอย่างเป็นอิสระ และความแตกต่างเชิงตัวเลขเล็กน้อยสามารถพลิกตัวเลือก top-k ได้ ทำให้เกิดความไม่ตรงกันระหว่างสิ่งที่สุ่มตัวอย่างกับสิ่งที่ได้รับการฝึกอบรม Molt จัดการเรื่องนี้ด้วย การเล่นซ้ำการกำหนดเส้นทางการเปิดตัว: vLLM ส่งคืนรหัสผู้เชี่ยวชาญต่อโทเค็น และการส่งผ่านการฝึกอบรมจะเล่นซ้ำการตัดสินใจกำหนดเส้นทางที่แน่นอนเหล่านั้น แทนที่จะรับมาอีกครั้ง
มีไว้เพื่ออะไร
สูตรการจัดส่งและกรณีการใช้งานที่จัดส่งชี้ไปยังจุดที่ NVIDIA คาดหวังว่า Molt จะถูกนำมาใช้: ตัวแทนการใช้เครื่องมือแบบหลายรอบ, ตัวแทนการรันโค้ด, สภาพแวดล้อมแบบภาษาวิสัยทัศน์ (เฟรมเวิร์กประกอบด้วยสูตร geo3k ที่จัดส่ง), ลูปรางวัล LLM ในฐานะผู้ตัดสิน และการกลั่นกรองตามนโยบายไปยังโมเดลนักเรียนที่มีขนาดเล็กลง สิ่งเหล่านี้คือปริมาณงานที่ขับเคลื่อนการเพิ่มขึ้นของ Agentic RL ทั่วทั้งอุตสาหกรรม และแต่ละอย่างก็ฉาวโฉ่ที่จะจัดการให้ถูกต้องภายใต้เงื่อนไขการสุ่มตัวอย่างแบบอะซิงก์ที่การเปิดตัวบางส่วนและการสุ่มตัวอย่างแบบอะซิงก์ที่การฝึกอบรมจริงกำหนดไว้
สัญญาณที่กว้างขึ้นก็คือ NVIDIA ไม่เพียงแต่ลงทุนใน GPU ที่ฝึกอบรมตัวแทนเท่านั้น แต่ยังลงทุนในกลุ่มซอฟต์แวร์ที่นักวิจัยใช้ในการสร้างพวกมันด้วย ด้วยการรักษาฐานโค้ดให้เล็กและอ่านง่าย และออกแบบอย่างชัดเจนเพื่อให้ผู้ช่วยเขียนโค้ด AI สามารถปรับเปลี่ยนได้ Molt สะท้อนถึงการเดิมพันว่าอนาคตของเครื่องมือ RL แบบเอเจนต์จะได้รับการพัฒนาร่วมกับโมเดลที่ใช้งาน
ก้าวนำหน้า AI
หากต้องการข้อมูลเพิ่มเติมเกี่ยวกับกรอบการทำงานที่ปรับเปลี่ยนวิธีการฝึกอบรมเจ้าหน้าที่ชายแดน โปรดติดตามฮับของเราสำหรับ การพัฒนา AI ล่าสุด
อ่านข่าว AI เพิ่มเติม →
