تیم NeMo انویدیا Molt را منتشر کرده است، یک چارچوب بومی PyTorch برای یادگیری تقویتی عاملی با یک هدف طراحی غیرعادی: یک پایگاه کد به اندازه ای کوچک که یک محقق بتواند آن را در سر خود نگه دارد - و یک دستیار کدنویسی هوش مصنوعی می تواند آن را به طور کامل بخواند و درباره آن استدلال کند. انتشار به عنوان RL عامل تبدیل به دستور العمل غالب برای آموزش مدل‌ها برای استفاده از ابزارها، نوشتن کد و مسیریابی در محیط‌ها می‌شود و یکی از چندین پروژه زیرساختی است که نحوه آموزش عوامل مرزی را تغییر می‌دهد. ما این تغییرات را در [اخبار فوری هوش مصنوعی] (https://aibuzzwire.news) پوشش می دهیم.

ساخته شده برای خواندن، نه فقط اجرا

همانطور که MarkTechPost گزارش می دهد، Molt تقریباً 8.6 هزار خط کد RL را اندازه گیری می کند که با ردیابی نمودار واردات از نقطه ورودی RL هر فریم ورک شمارش می شود. همین روش حدود 62 هزار خط برای verl، 25 هزار برای slime و 7.2 هزار برای OpenRLHF محاسبه می کند. این فشردگی عمدی محور اصلی پروژه است: تحقیقات RL عاملی اصلاح الگوریتم ثابت است - برآوردگرهای جدید، مراحل جدید خط لوله، طرح‌های عرضه جدید - و در چارچوب‌های جریان اصلی، هر رشته تغییری از طریق لایه‌های مربی، پشتیبان توزیع شده، و چسب پخش می‌گذرد. هدف Molt حذف این اصطکاک است.

این چارچوب دارای مجوز Apache 2.0 است و با کدهای راه اندازی، اسکریپت های Slurm و یک کانتینر از پیش ساخته شده ارسال می شود. با این حال، NVIDIA واضح است که مقاله تحقیقاتی همراه، Molt را به‌عنوان زیرساخت تحقیقاتی به‌جای یک سرویس آموزشی تولید معرفی می‌کند، و سخت‌افزار دروازه‌بان واقعی است. دستور العمل های ارسال شده 2 گره از 8 پردازنده گرافیکی H100 ، تقسیم 8 برای آموزش و 8 برای عرضه را فرض می کنند. این امر آن را در دسترس آزمایشگاه‌های مرزی و مجاور مرزی، استارت‌آپ‌های دارای بودجه خوب که پس از آموزش انجام می‌دهند، گروه‌های تحقیقاتی هوش مصنوعی سازمانی و گروه‌های دانشگاهی با دسترسی چند گره H100 یا H200 قرار می‌دهد.

ترکیب شده، نه چنگال

معماری Molt سه ابزار موجود را بدون دوشاخه کردن هیچ‌کدام از آنها تشکیل می‌دهد، بنابراین پیشرفت‌های بالادستی به‌عنوان یک پین ظرف به‌جای یک تغییر دردناک به دست می‌آیند. از Ray برای قرار دادن و صف‌های ناهمزمان، vLLM برای عرضه و NVIDIA AutoModel با FSDP2 برای آموزش استفاده می‌کند. زمان اجرا شامل یک agent pool، مجموعه‌ای از موتورهای vLLM در پشت یک روتر درخواست، و یک بازیگر سیاست قابل آموزش است. یک استخر استریم گروه‌های سریع را در حال پرواز نگه می‌دارد تا در حین تمرین بازیگر، موتورها هرگز تخلیه نشوند.

قابلیتی به نام پرداخت جزئی برای کارایی مرکزی است. وقتی خط‌مشی به‌روزرسانی می‌شود، Molt موتورها را متوقف می‌کند، خرده‌های به‌روز شده بازیگر را از طریق NCCL مستقیماً برای هر موتور پخش می‌کند، و درخواست‌های حفظ شده را به جای دور انداختن آنها از سر می‌گیرد. این از الگوی بیهوده دور ریختن برنامه های در حال پیشرفت هر بار که مدل تغییر می کند، جلوگیری می کند.

یک ماژول، دو فرم عامل

یک RL اجرا شده در Molt یک ماژول پایتون را نام می‌برد که AgentRunner را صادر می‌کند، و هر چیز دیگری - از جمله تابع پاداش - کد معمولی است. چارچوب از دو فرم پشتیبانی می کند. با Env، فریم ورک دارای حلقه LLM در داخل یک «step()» هم‌تراز با Gymnasium است که با الگوی یادگیری تقویتی آشنا مطابقت دارد. با ChatAgent، کاربر حلقه را از طریق یک OpenAI سهام یا Anthropic SDK در اختیار دارد، و این کار را آسان می کند تا یک عامل موجود را بپیچد.

برای پل زدن هر دو، Molt یک سرور حلقه بک را راه اندازی می کند که هر دو پروتکل سیمی را صحبت می کند، و هر درخواست در سمت سرور در یک تجمع دقیق رمزگشایی می شود. وقتی یک عامل افق بلند زمینه خود را فشرده می کند و پیشوند را بازنویسی می کند - یک عملیات معمول برای عواملی که برای چندین نوبت اجرا می شوند - سرور بخش فعلی را مهر و موم می کند و یک قسمت جدید را به طور خودکار باز می کند. این نوعی از جزئیات لوله کشی است که تعیین می کند آیا اجرای RL عامل در عمل درست است یا فقط درست به نظر می رسد.

سه متغیر صحت

طراحی Molt حول سه متغیر صحت سازماندهی شده است که به شکست های ظریف آموزش عامل ناهمزمان می پردازد. هویت توکن به این معنی است که شناسه‌های نشانه نمونه‌برداری شده مسیر را مشخص می‌کنند، نه رونوشت‌های توکن‌سازی‌شده - مهم است زیرا برگرداندن متن به توکن‌ها می‌تواند داده‌ها را بی‌صدا تغییر دهد. معناشناسی نسخه سیاست تضمین می‌کند که نشانه‌های آموزش‌پذیر، احتمالات گزارش سیاست رفتاری خود را حفظ می‌کنند، با استفاده ناهمزمان که در هر توکن در پشت یک گیت در سطح توالی تصحیح می‌شود. پیوستگی رو به جلو مستلزم آن است که موتور عرضه و بازیگر آموزش در مورد معناشناسی مدل به توافق برسند.

این آخرین تغییر ناپذیر بیشترین اهمیت را برای سیاست‌های ترکیبی از کارشناسان (MOE) دارد، که به طور فزاینده‌ای رایج هستند. روترهای راه‌اندازی و آموزشی، متخصصان را به‌طور مستقل انتخاب می‌کنند، و تفاوت‌های عددی کوچک می‌تواند گزینه‌های برتر را تغییر دهد و باعث ایجاد عدم تطابق بین آنچه که نمونه‌برداری شده و آنچه در آن آموزش داده شده است، شود. Molt این موضوع را با بازپخش مسیریابی رونمایی ** حل می‌کند: vLLM شناسه‌های خبره هر توکن خود را برمی‌گرداند و پاس آموزشی به جلو آن تصمیم‌های مسیریابی دقیق را به‌جای استخراج مجدد آن‌ها بازپخش می‌کند.

برای چیست

دستور العمل های ارسال شده و موارد استفاده به جایی اشاره می کنند که NVIDIA انتظار دارد که Molt مورد استفاده قرار گیرد: عوامل استفاده از ابزار چند نوبتی، عوامل اجرای کد، محیط های زبان بینایی (چارچوب شامل دستور geo3k ارسال شده)، حلقه های پاداش LLM-as-judge، و تقطیر روی خط مشی بر روی یک مدل دانشجویی کوچکتر. اینها دقیقاً بارهای کاری هستند که باعث افزایش RL عامل در سراسر صنعت شده است، و هر یک از آنها به طرز بدنامی تحت شرایط نمونه برداری ناهمگام و نمونه برداری جزئی که آموزش واقعی تحمیل می کند، به طرز نامفهومی انجام می شود.

سیگنال گسترده‌تر این است که NVIDIA نه تنها روی پردازنده‌های گرافیکی که عوامل را آموزش می‌دهند، بلکه روی نرم‌افزاری که محققان برای ساخت آنها استفاده می‌کنند، سرمایه‌گذاری می‌کند. Molt با کوچک و خوانا نگه‌داشتن پایگاه کد – و طراحی صریح آن به‌گونه‌ای که دستیار کدنویسی هوش مصنوعی بتواند آن را تغییر دهد، این شرط را منعکس می‌کند که آینده ابزارهای RL عاملی با مدل‌هایی که از آن استفاده می‌کنند توسعه خواهد یافت.

از هوش مصنوعی جلوتر بمانید

برای اطلاعات بیشتر در مورد چارچوب‌هایی که نحوه آموزش عوامل مرزی را تغییر می‌دهند، مرکز ما را برای آخرین پیشرفت‌های هوش مصنوعی دنبال کنید.

اخبار هوش مصنوعی را بیشتر بخوانید →