أصدر فريق NeMo التابع لـ NVIDIA Molt، وهو إطار عمل أصلي من PyTorch للتعلم المعزز الوكيل مع هدف تصميم غير عادي: قاعدة تعليمات برمجية صغيرة بما يكفي بحيث يمكن للباحث الاحتفاظ بها في رأسه - ويمكن لمساعد البرمجة بالذكاء الاصطناعي قراءتها والتفكير فيها بالكامل. يتم إطلاق الإصدار عندما يصبح وكيل RL هو الوصفة السائدة لنماذج التدريس لاستخدام الأدوات وكتابة التعليمات البرمجية والتنقل في البيئات، وهو واحد من العديد من مشاريع البنية التحتية التي تعيد تشكيل كيفية تدريب عملاء الحدود. نحن نغطي هذه التحولات في أخبار الذكاء الاصطناعي العاجلة.

مصمم للقراءة، وليس للتشغيل فقط

وفقًا لتقارير MarkTechPost، يقيس Molt تقريبًا 8.6 ألف سطر من كود RL، ويتم حسابها عن طريق تتبع الرسم البياني للاستيراد من نقطة دخول RL لكل إطار عمل. تحسب نفس الطريقة حوالي 62 ألف سطر لـ verl، و25 ألف سطر لـ Slime، و7.2 ألف لـ OpenRLHF. هذا الاكتناز المتعمد هو الفكرة المركزية للمشروع: بحث RL الوكيل هو تعديل مستمر للخوارزمية - مقدرات جديدة، ومراحل خطوط أنابيب جديدة، ومخططات طرح جديدة - وفي الأطر السائدة، كل تغيير يمر عبر طبقات من المدرب، والواجهة الخلفية الموزعة، وغراء الطرح. يهدف مولت إلى إزالة هذا الاحتكاك.

إطار العمل Apache 2.0 مرخص ويأتي مزودًا برموز التشغيل والبرامج النصية Slurm وحاوية تم إنشاؤها مسبقًا. ومع ذلك، فإن NVIDIA واضحة في أن الورقة البحثية المصاحبة تضع Molt كبنية تحتية بحثية بدلاً من خدمة تدريب على الإنتاج، وأن الأجهزة هي حارس البوابة الحقيقي. تفترض الوصفات المشحونة عقدتان من 8 وحدات معالجة رسوميات H100، مقسمة إلى 8 للتدريب و8 للطرح. وهذا يضعها في متناول المختبرات الحدودية والمجاورة، والشركات الناشئة الممولة جيدًا والتي تقوم بالتدريب اللاحق، ومجموعات أبحاث الذكاء الاصطناعي المؤسسية، والمجموعات الأكاديمية التي تتمتع بإمكانية الوصول متعدد العقد إلى H100 أو H200.

مؤلف، غير متشعب

تتكون بنية Molt من ثلاث أدوات موجودة دون الحاجة إلى تشعب لأي منها، لذا فإن التحسينات الأولية تصل كدبوس حاوية بدلاً من إعادة الأساس المؤلم. يستخدم Ray لوضع قوائم الانتظار غير المتزامنة، وvLLM للتشغيل، وNVIDIA AutoModel مع FSDP2 للتدريب. يتكون وقت التشغيل من تجمع وكلاء، ومجموعة من محركات vLLM خلف موجه الطلب، وممثل سياسة واحد قابل للتدريب. يحافظ تجمع البث على المجموعات السريعة في الرحلة حتى لا تستنزف المحركات أبدًا أثناء تدريب الممثل.

تعد الميزة التي تسمى الطرح الجزئي أمرًا أساسيًا لتحقيق الكفاءة. عندما يتم تحديث السياسة، يقوم Molt بإيقاف المحركات مؤقتًا، ويبث الأجزاء المحدثة للممثل عبر NCCL مباشرة إلى كل محرك، ويستأنف الطلبات المحتجزة بدلاً من التخلص منها. يؤدي ذلك إلى تجنب النمط المسرف المتمثل في التخلص من عمليات النشر الجارية في كل مرة يتغير فيها النموذج.

وحدة واحدة، نموذجان للوكلاء

يسمي تشغيل RL في Molt وحدة Python واحدة تصدر AgentRunner، وكل شيء آخر - بما في ذلك وظيفة المكافأة - هو رمز عادي. يدعم الإطار شكلين. باستخدام Env، يمتلك إطار العمل حلقة LLM داخل `step()` محاذية لـ Gymnasium، والتي تناسب نمط التعلم المعزز المألوف. باستخدام ChatAgent، يمتلك المستخدم الحلقة من خلال مخزون OpenAI أو Anthropic SDK، مما يجعل من السهل تغليف وكيل موجود.

ولسد الفجوة بينهما، يطلق Molt خادم استرجاع يتحدث كلا البروتوكولين السلكيين، ويتم فك تشفير كل طلب من جانب الخادم في تراكم رمزي واحد بالضبط. عندما يقوم وكيل طويل الأفق بضغط سياقه وإعادة كتابة البادئة - وهي عملية شائعة للوكلاء الذين يعملون لعدة دورات - يقوم الخادم بإغلاق المقطع الحالي وفتح مقطع جديد تلقائيًا. هذا هو نوع تفاصيل السباكة التي تحدد ما إذا كان تشغيل RL الوكيل صحيحًا من الناحية العملية أم أنه يبدو صحيحًا فقط.

ثلاثة ثوابت للصواب

يتم تنظيم تصميم مولت حول ثلاثة ثوابت صحيحة تعالج الإخفاقات الدقيقة للتدريب الوكيل غير المتزامن. هوية الرمز المميز تعني أن معرفات الرموز المميزة التي تم أخذ عينات منها تحدد المسار، وليس النص المعاد ترميزه - وهو أمر مهم لأن دمج النص مرة أخرى في الرموز المميزة يمكن أن يغير البيانات بصمت. دلالات إصدار السياسة تضمن احتفاظ الرموز المميزة القابلة للتدريب باحتمالات سجل سياسة السلوك الخاصة بها، مع تصحيح الاستخدام غير المتزامن لكل رمز مميز خلف بوابة على مستوى التسلسل. يتطلب الاتساق المستقبلي أن يتفق محرك التشغيل وممثل التدريب على دلالات النموذج.

وهذا الثابت الأخير هو الأكثر أهمية بالنسبة لـ سياسات خليط الخبراء، والتي أصبحت شائعة بشكل متزايد. تختار أجهزة التوجيه والتدريب الخبراء بشكل مستقل، ويمكن للاختلافات الرقمية الصغيرة أن تقلب الاختيارات الأفضل، مما يؤدي إلى عدم التطابق بين ما تم أخذ عينات منه وما يتم التدريب عليه. يعالج Molt هذه المشكلة من خلال إعادة تشغيل توجيه الطرح: يقوم vLLM بإرجاع معرفات الخبراء لكل رمز مميز، ويقوم تمرير التدريب الأمامي بإعادة تشغيل قرارات التوجيه الدقيقة هذه بدلاً من إعادة اشتقاقها.

الغرض منه

تشير الوصفات التي تم شحنها وحالات الاستخدام إلى المكان الذي تتوقع NVIDIA أن يتم اعتماد Molt فيه: وكلاء استخدام الأدوات متعددي الأدوار، ووكلاء تنفيذ التعليمات البرمجية، وبيئات لغة الرؤية (يتضمن الإطار وصفة Geo3k مشحونة)، وحلقات مكافأة LLM كقاضي، والتقطير على السياسة على نموذج طالب أصغر. هذه هي على وجه التحديد أعباء العمل التي أدت إلى الارتفاع الكبير في RL الوكيل عبر الصناعة، ومن المعروف أن كل واحدة منها تافهة للتكيف مع ظروف التشغيل الجزئي وأخذ العينات غير المتزامنة التي يفرضها التدريب الحقيقي.

الإشارة الأوسع هي أن شركة NVIDIA لا تستثمر فقط في وحدات معالجة الرسوميات التي تدرب العملاء، بل أيضًا في مجموعة البرامج التي يستخدمها الباحثون لبنائها. من خلال الحفاظ على قاعدة التعليمات البرمجية صغيرة وقابلة للقراءة - وتصميمها بشكل صريح بحيث يمكن لمساعد ترميز الذكاء الاصطناعي تعديلها - يعكس Molt رهانًا على أن مستقبل أدوات RL الوكيل سيتم تطويره بالاشتراك مع النماذج التي تستخدمها.

البقاء في صدارة الذكاء الاصطناعي

لمعرفة المزيد عن الأطر التي تعيد تشكيل كيفية تدريب عملاء الحدود، تابع مركزنا للاطلاع على أحدث تطورات الذكاء الاصطناعي.

اقرأ المزيد من أخبار الذكاء الاصطناعي →