ساخته شده برای خواندن، نه فقط اجرا
همانطور که MarkTechPost گزارش می دهد، Molt تقریباً 8.6 هزار خط کد RL را اندازه گیری می کند که با ردیابی نمودار واردات از نقطه ورودی RL هر فریم ورک شمارش می شود. همین روش حدود 62 هزار خط برای verl، 25 هزار برای slime و 7.2 هزار برای OpenRLHF محاسبه می کند. این فشردگی عمدی محور اصلی پروژه است: تحقیقات RL عاملی اصلاح الگوریتم ثابت است - برآوردگرهای جدید، مراحل جدید خط لوله، طرحهای عرضه جدید - و در چارچوبهای جریان اصلی، هر رشته تغییری از طریق لایههای مربی، پشتیبان توزیع شده، و چسب پخش میگذرد. هدف Molt حذف این اصطکاک است.
این چارچوب دارای مجوز Apache 2.0 است و با کدهای راه اندازی، اسکریپت های Slurm و یک کانتینر از پیش ساخته شده ارسال می شود. با این حال، NVIDIA واضح است که مقاله تحقیقاتی همراه، Molt را بهعنوان زیرساخت تحقیقاتی بهجای یک سرویس آموزشی تولید معرفی میکند، و سختافزار دروازهبان واقعی است. دستور العمل های ارسال شده 2 گره از 8 پردازنده گرافیکی H100 ، تقسیم 8 برای آموزش و 8 برای عرضه را فرض می کنند. این امر آن را در دسترس آزمایشگاههای مرزی و مجاور مرزی، استارتآپهای دارای بودجه خوب که پس از آموزش انجام میدهند، گروههای تحقیقاتی هوش مصنوعی سازمانی و گروههای دانشگاهی با دسترسی چند گره H100 یا H200 قرار میدهد.
ترکیب شده، نه چنگال
معماری Molt سه ابزار موجود را بدون دوشاخه کردن هیچکدام از آنها تشکیل میدهد، بنابراین پیشرفتهای بالادستی بهعنوان یک پین ظرف بهجای یک تغییر دردناک به دست میآیند. از Ray برای قرار دادن و صفهای ناهمزمان، vLLM برای عرضه و NVIDIA AutoModel با FSDP2 برای آموزش استفاده میکند. زمان اجرا شامل یک agent pool، مجموعهای از موتورهای vLLM در پشت یک روتر درخواست، و یک بازیگر سیاست قابل آموزش است. یک استخر استریم گروههای سریع را در حال پرواز نگه میدارد تا در حین تمرین بازیگر، موتورها هرگز تخلیه نشوند.
قابلیتی به نام پرداخت جزئی برای کارایی مرکزی است. وقتی خطمشی بهروزرسانی میشود، Molt موتورها را متوقف میکند، خردههای بهروز شده بازیگر را از طریق NCCL مستقیماً برای هر موتور پخش میکند، و درخواستهای حفظ شده را به جای دور انداختن آنها از سر میگیرد. این از الگوی بیهوده دور ریختن برنامه های در حال پیشرفت هر بار که مدل تغییر می کند، جلوگیری می کند.
یک ماژول، دو فرم عامل
یک RL اجرا شده در Molt یک ماژول پایتون را نام میبرد که AgentRunner را صادر میکند، و هر چیز دیگری - از جمله تابع پاداش - کد معمولی است. چارچوب از دو فرم پشتیبانی می کند. با Env، فریم ورک دارای حلقه LLM در داخل یک «step()» همتراز با Gymnasium است که با الگوی یادگیری تقویتی آشنا مطابقت دارد. با ChatAgent، کاربر حلقه را از طریق یک OpenAI سهام یا Anthropic SDK در اختیار دارد، و این کار را آسان می کند تا یک عامل موجود را بپیچد.
برای پل زدن هر دو، Molt یک سرور حلقه بک را راه اندازی می کند که هر دو پروتکل سیمی را صحبت می کند، و هر درخواست در سمت سرور در یک تجمع دقیق رمزگشایی می شود. وقتی یک عامل افق بلند زمینه خود را فشرده می کند و پیشوند را بازنویسی می کند - یک عملیات معمول برای عواملی که برای چندین نوبت اجرا می شوند - سرور بخش فعلی را مهر و موم می کند و یک قسمت جدید را به طور خودکار باز می کند. این نوعی از جزئیات لوله کشی است که تعیین می کند آیا اجرای RL عامل در عمل درست است یا فقط درست به نظر می رسد.
سه متغیر صحت
طراحی Molt حول سه متغیر صحت سازماندهی شده است که به شکست های ظریف آموزش عامل ناهمزمان می پردازد. هویت توکن به این معنی است که شناسههای نشانه نمونهبرداری شده مسیر را مشخص میکنند، نه رونوشتهای توکنسازیشده - مهم است زیرا برگرداندن متن به توکنها میتواند دادهها را بیصدا تغییر دهد. معناشناسی نسخه سیاست تضمین میکند که نشانههای آموزشپذیر، احتمالات گزارش سیاست رفتاری خود را حفظ میکنند، با استفاده ناهمزمان که در هر توکن در پشت یک گیت در سطح توالی تصحیح میشود. پیوستگی رو به جلو مستلزم آن است که موتور عرضه و بازیگر آموزش در مورد معناشناسی مدل به توافق برسند.
این آخرین تغییر ناپذیر بیشترین اهمیت را برای سیاستهای ترکیبی از کارشناسان (MOE) دارد، که به طور فزایندهای رایج هستند. روترهای راهاندازی و آموزشی، متخصصان را بهطور مستقل انتخاب میکنند، و تفاوتهای عددی کوچک میتواند گزینههای برتر را تغییر دهد و باعث ایجاد عدم تطابق بین آنچه که نمونهبرداری شده و آنچه در آن آموزش داده شده است، شود. Molt این موضوع را با بازپخش مسیریابی رونمایی ** حل میکند: vLLM شناسههای خبره هر توکن خود را برمیگرداند و پاس آموزشی به جلو آن تصمیمهای مسیریابی دقیق را بهجای استخراج مجدد آنها بازپخش میکند.
برای چیست
دستور العمل های ارسال شده و موارد استفاده به جایی اشاره می کنند که NVIDIA انتظار دارد که Molt مورد استفاده قرار گیرد: عوامل استفاده از ابزار چند نوبتی، عوامل اجرای کد، محیط های زبان بینایی (چارچوب شامل دستور geo3k ارسال شده)، حلقه های پاداش LLM-as-judge، و تقطیر روی خط مشی بر روی یک مدل دانشجویی کوچکتر. اینها دقیقاً بارهای کاری هستند که باعث افزایش RL عامل در سراسر صنعت شده است، و هر یک از آنها به طرز بدنامی تحت شرایط نمونه برداری ناهمگام و نمونه برداری جزئی که آموزش واقعی تحمیل می کند، به طرز نامفهومی انجام می شود.
سیگنال گستردهتر این است که NVIDIA نه تنها روی پردازندههای گرافیکی که عوامل را آموزش میدهند، بلکه روی نرمافزاری که محققان برای ساخت آنها استفاده میکنند، سرمایهگذاری میکند. Molt با کوچک و خوانا نگهداشتن پایگاه کد – و طراحی صریح آن بهگونهای که دستیار کدنویسی هوش مصنوعی بتواند آن را تغییر دهد، این شرط را منعکس میکند که آینده ابزارهای RL عاملی با مدلهایی که از آن استفاده میکنند توسعه خواهد یافت.
از هوش مصنوعی جلوتر بمانید
برای اطلاعات بیشتر در مورد چارچوبهایی که نحوه آموزش عوامل مرزی را تغییر میدهند، مرکز ما را برای آخرین پیشرفتهای هوش مصنوعی دنبال کنید.
اخبار هوش مصنوعی را بیشتر بخوانید →
