Được xây dựng để đọc chứ không chỉ để chạy
Theo báo cáo của MarkTechPost, Molt đo khoảng 8,6 nghìn dòng mã RL, được tính bằng cách truy tìm biểu đồ nhập từ điểm nhập RL của mỗi khung. Phương pháp tương tự tính được khoảng 62K dòng cho verl, 25K cho slime và 7,2K cho OpenRLHF. Sự thu gọn có chủ ý đó là trọng tâm của dự án: nghiên cứu RL tác nhân là sửa đổi thuật toán liên tục — công cụ ước tính mới, giai đoạn quy trình mới, kế hoạch triển khai mới — và trong các khung chính thống, mọi luồng thay đổi thông qua các lớp huấn luyện, chương trình phụ trợ phân tán và keo triển khai. Molt nhằm mục đích loại bỏ sự xích mích đó.
Khung này được Apache 2.0 cấp phép và đi kèm với mã khởi chạy, tập lệnh Slurm và vùng chứa dựng sẵn. Tuy nhiên, NVIDIA nói rõ rằng tài liệu nghiên cứu đi kèm coi Molt là cơ sở hạ tầng nghiên cứu hơn là một dịch vụ đào tạo sản xuất và phần cứng mới là người gác cổng thực sự. Các công thức được gửi đi giả định 2 nút gồm 8 GPU H100, chia 8 nút để đào tạo và 8 nút để triển khai. Điều đó đặt nó trong tầm tay của các phòng thí nghiệm biên giới và liền kề biên giới, các công ty khởi nghiệp được tài trợ tốt đang thực hiện đào tạo sau, các nhóm nghiên cứu AI doanh nghiệp và các nhóm học thuật có quyền truy cập H100 hoặc H200 đa nút.
Được soạn thảo, không phân nhánh
Kiến trúc của Molt bao gồm ba công cụ hiện có mà không phân nhánh bất kỳ công cụ nào trong số đó, do đó, các cải tiến ngược dòng xuất hiện dưới dạng ghim vùng chứa thay vì khởi động lại một cách đau đớn. Nó sử dụng Ray cho vị trí và hàng đợi không đồng bộ, vLLM để triển khai và NVIDIA AutoModel với FSDP2 để đào tạo. Thời gian chạy bao gồm một nhóm tác nhân, một tập hợp các công cụ vLLM phía sau bộ định tuyến yêu cầu và một tác nhân chính sách có thể đào tạo được. Nhóm phát trực tuyến giúp các nhóm nhanh chóng bay để động cơ không bao giờ cạn kiệt trong khi diễn viên luyện tập.
Tính năng được gọi là triển khai một phần là trọng tâm của tính hiệu quả. Khi chính sách cập nhật, Molt tạm dừng các công cụ, phát trực tiếp các phân đoạn đã cập nhật của tác nhân qua NCCL tới từng công cụ và tiếp tục các yêu cầu được giữ lại thay vì loại bỏ chúng. Điều đó tránh được tình trạng lãng phí khi vứt bỏ các bản triển khai đang thực hiện mỗi khi mô hình thay đổi.
Một mô-đun, hai biểu mẫu đại lý
Một RL chạy trong Molt đặt tên cho một mô-đun Python duy nhất xuất AgentRunner và mọi thứ khác — bao gồm cả hàm phần thưởng — là mã thông thường. Khung này hỗ trợ hai hình thức. Với Env, khung này sở hữu vòng lặp LLM bên trong `step()` phù hợp với Phòng tập thể dục, phù hợp với mô hình học tập tăng cường quen thuộc. Với ChatAgent, người dùng sở hữu vòng lặp thông qua OpenAI hoặc Anthropic SDK gốc, giúp việc bao bọc một tác nhân hiện có trở nên đơn giản.
Để kết nối cả hai, Molt khởi chạy máy chủ loopback nói cả hai giao thức có dây và mọi yêu cầu đều được giải mã phía máy chủ thành một tập hợp chính xác bằng mã thông báo. Khi một tác nhân có tầm nhìn dài thu gọn bối cảnh của nó và viết lại tiền tố — một thao tác phổ biến đối với các tác nhân chạy trong nhiều lượt — máy chủ sẽ niêm phong phân đoạn hiện tại và tự động mở một phân đoạn mới. Đây là loại chi tiết hệ thống ống nước xác định xem việc chạy RL tác nhân có chính xác trong thực tế hay chỉ trông có vẻ chính xác.
Ba bất biến chính xác
Thiết kế của Molt được tổ chức xung quanh ba bất biến về tính chính xác nhằm giải quyết các lỗi nhỏ của quá trình đào tạo tác nhân không đồng bộ. Nhận dạng mã thông báo có nghĩa là id mã thông báo được lấy mẫu xác định quỹ đạo chứ không phải bản ghi được mã hóa lại — quan trọng vì việc ghép văn bản trở lại mã thông báo có thể âm thầm thay đổi dữ liệu. Ngữ nghĩa của phiên bản chính sách đảm bảo mã thông báo có thể huấn luyện giữ nguyên xác suất nhật ký chính sách hành vi của chúng, với việc sử dụng không đồng bộ được sửa cho mỗi mã thông báo phía sau cổng cấp trình tự. Tính nhất quán về phía trước yêu cầu công cụ triển khai và tác nhân đào tạo phải thống nhất về ngữ nghĩa của mô hình.
Bất biến cuối cùng đó quan trọng nhất đối với chính sách hỗn hợp các chuyên gia (MoE), vốn ngày càng phổ biến. Các bộ định tuyến triển khai và đào tạo sẽ lựa chọn các chuyên gia một cách độc lập và những khác biệt nhỏ về số lượng có thể làm đảo lộn các lựa chọn hàng đầu, tạo ra sự không khớp giữa những gì được lấy mẫu và những gì đang được đào tạo. Molt giải quyết vấn đề này bằng cách phát lại định tuyến triển khai: vLLM trả về id chuyên gia cho mỗi mã thông báo và thẻ chuyển tiếp đào tạo sẽ phát lại các quyết định định tuyến chính xác đó thay vì lấy lại chúng.
Nó dùng để làm gì
Các công thức được chuyển giao và các trường hợp sử dụng chỉ ra nơi NVIDIA kỳ vọng Molt sẽ được áp dụng: tác nhân sử dụng công cụ nhiều lượt, tác nhân thực thi mã, môi trường ngôn ngữ tầm nhìn (khuôn khổ bao gồm công thức geo3k được chuyển tải), vòng lặp phần thưởng LLM-với tư cách là thẩm phán và chắt lọc chính sách cho một mô hình sinh viên nhỏ hơn. Đây chính xác là những khối lượng công việc đã thúc đẩy sự gia tăng RL tác nhân trong toàn ngành và mỗi khối lượng đều nổi tiếng là khó thực hiện ngay trong các điều kiện lấy mẫu không đồng bộ, triển khai một phần mà quá trình đào tạo thực sự áp đặt.
Tín hiệu rộng hơn là NVIDIA đang đầu tư không chỉ vào GPU đào tạo các đại lý mà còn vào hệ thống phần mềm mà các nhà nghiên cứu sử dụng để xây dựng chúng. Bằng cách giữ cho cơ sở mã nhỏ và dễ đọc — đồng thời thiết kế nó một cách rõ ràng để trợ lý mã hóa AI có thể sửa đổi nó — Molt phản ánh sự đặt cược rằng tương lai của công cụ RL tác nhân sẽ được đồng phát triển với các mô hình sử dụng nó.
Đi trước AI
Để biết thêm về các khuôn khổ định hình lại cách đào tạo các đặc vụ biên giới, hãy theo dõi trung tâm của chúng tôi để biết những phát triển AI mới nhất.
Đọc thêm tin tức về AI →
