বিল্ট টু বি পড়ার, শুধু রান নয়
যেমন MarkTechPost রিপোর্ট করে, Molt মোটামুটি 8.6K লাইন RL কোডের পরিমাপ করে, প্রতিটি ফ্রেমওয়ার্কের RL এন্ট্রি পয়েন্ট থেকে আমদানি গ্রাফ ট্রেস করে গণনা করা হয়। একই পদ্ধতিতে verl-এর জন্য প্রায় 62K লাইন, স্লাইমের জন্য 25K এবং OpenRLHF-এর জন্য 7.2K লাইন লম্বা হয়। সেই ইচ্ছাকৃত কমপ্যাক্টনেস হল প্রকল্পের কেন্দ্রীয় পিচ: এজেন্টিক RL গবেষণা হল ধ্রুবক অ্যালগরিদম পরিবর্তন — নতুন অনুমানকারী, নতুন পাইপলাইন পর্যায়, নতুন রোলআউট স্কিম — এবং মূলধারার কাঠামোতে প্রশিক্ষক, ডিস্ট্রিবিউটেড-ব্যাকএন্ড এবং রোলআউট আঠার স্তরগুলির মাধ্যমে প্রতিটি পরিবর্তন থ্রেড। Molt যে ঘর্ষণ অপসারণ লক্ষ্য.
ফ্রেমওয়ার্ক হল Apache 2.0 লাইসেন্সযুক্ত এবং লঞ্চ কোড, স্লার্ম স্ক্রিপ্ট এবং একটি পূর্বনির্মাণ কন্টেইনার সহ জাহাজ। NVIDIA স্পষ্ট, যাইহোক, সহগামী গবেষণা পত্র মোল্টকে একটি উত্পাদন প্রশিক্ষণ পরিষেবার পরিবর্তে গবেষণা অবকাঠামো হিসাবে অবস্থান করে এবং হার্ডওয়্যার হল আসল দারোয়ান। পাঠানো রেসিপি 8 H100 GPU-এর 2টি নোড, প্রশিক্ষণের জন্য 8টি এবং রোলআউটের জন্য 8টি বিভক্ত করে। এটি এটিকে সীমান্ত এবং সীমান্ত-সংলগ্ন ল্যাবগুলির নাগালের মধ্যে রাখে, প্রশিক্ষণ-পরবর্তী ভাল-অর্থায়ন করা স্টার্টআপগুলি, এন্টারপ্রাইজ এআই গবেষণা গ্রুপগুলি এবং মাল্টি-নোড H100 বা H200 অ্যাক্সেস সহ একাডেমিক গ্রুপগুলি।
রচিত, কাঁটাযুক্ত নয়
Molt এর আর্কিটেকচার তিনটি বিদ্যমান টুলস কম্পোজ করে সেগুলোর কোনোটিকে কাঁটা ছাড়াই, তাই আপস্ট্রিম উন্নতিগুলি একটি বেদনাদায়ক রিবেসের পরিবর্তে একটি ধারক পিন হিসাবে আসে। এটি প্লেসমেন্ট এবং অ্যাসিঙ্ক্রোনাস সারিগুলির জন্য Ray, রোলআউটের জন্য vLLM এবং প্রশিক্ষণের জন্য FSDP2 সহ **NVIDIA AutoModel ব্যবহার করে। রানটাইম একটি এজেন্ট পুল, একটি অনুরোধ রাউটারের পিছনে ভিএলএলএম ইঞ্জিনের একটি সেট এবং একটি একক প্রশিক্ষণযোগ্য নীতি অভিনেতা নিয়ে গঠিত। একটি স্ট্রিমিং পুল প্রম্পট গ্রুপগুলিকে ফ্লাইটে রাখে যাতে অভিনেতা ট্রেনের সময় ইঞ্জিনগুলি কখনই নিষ্কাশন না হয়।
আংশিক রোলআউট নামক একটি বৈশিষ্ট্য কার্যকারিতার কেন্দ্রবিন্দু। যখন নীতি আপডেট হয়, মোল্ট ইঞ্জিনগুলিকে বিরতি দেয়, প্রতিটি ইঞ্জিনে সরাসরি NCCL-এর উপর অভিনেতার আপডেট করা শার্ডগুলি সম্প্রচার করে, এবং রক্ষিত অনুরোধগুলি বাতিল না করে পুনরায় শুরু করে৷ এটি প্রতিবার মডেল পরিবর্তিত হওয়ার সময় প্রগতিশীল রোলআউটগুলি ফেলে দেওয়ার অপব্যয় প্যাটার্ন এড়িয়ে যায়।একটি মডিউল, দুটি এজেন্ট ফর্ম
Molt-এ চালানো একটি RL একটি পাইথন মডিউলের নাম দেয় যা একটি AgentRunner রপ্তানি করে, এবং বাকি সবকিছু — রিওয়ার্ড ফাংশন সহ — সাধারণ কোড। ফ্রেমওয়ার্ক দুটি ফর্ম সমর্থন করে. Env এর সাথে, ফ্রেমওয়ার্ক জিমনেসিয়াম-সারিবদ্ধ `স্টেপ()` এর ভিতরে LLM লুপের মালিক, যা পরিচিত শক্তিবৃদ্ধি-শিক্ষার প্যাটার্নের সাথে খাপ খায়। ChatAgent-এর মাধ্যমে, ব্যবহারকারী একটি স্টক OpenAI বা Anthropic SDK-এর মাধ্যমে লুপের মালিক হন, যা একটি বিদ্যমান এজেন্টকে মোড়ানো সহজ করে তোলে।
উভয়ই সেতু করার জন্য, Molt একটি লুপব্যাক সার্ভার চালু করে যা উভয় ওয়্যার প্রোটোকলের কথা বলে এবং প্রতিটি অনুরোধ সার্ভার-সাইডে একটি টোকেন-সঠিক সংগ্রহে ডিকোড করা হয়। যখন একটি দীর্ঘ-দিগন্ত এজেন্ট তার প্রসঙ্গ কম্প্যাক্ট করে এবং উপসর্গটি পুনর্লিখন করে — এজেন্টদের জন্য একটি সাধারণ ক্রিয়াকলাপ যা অনেকগুলি মোড়ের জন্য চলে — সার্ভার বর্তমান সেগমেন্টটি সিল করে এবং স্বয়ংক্রিয়ভাবে একটি নতুন খোলে। এই ধরনের নদীর গভীরতানির্ণয় বিশদ যা নির্ধারণ করে যে একটি এজেন্টিক RL রান অনুশীলনে সঠিক নাকি ঠিক দেখায়।
তিনটি সঠিকতা অপরিবর্তনীয়
মোল্টের নকশা তিনটি শুদ্ধতা পরিবর্তনের চারপাশে সংগঠিত হয় যা অ্যাসিঙ্ক্রোনাস এজেন্টিক প্রশিক্ষণের সূক্ষ্ম ব্যর্থতার সমাধান করে। টোকেন আইডেন্টিটি মানে নমুনাযুক্ত টোকেন আইডি ট্র্যাজেক্টোরিকে সংজ্ঞায়িত করে, একটি পুনঃটোকেনাইজড ট্রান্সক্রিপ্ট নয় — গুরুত্বপূর্ণ কারণ টেক্সটকে টোকেনে আবার স্টিচ করা নীরবে ডেটা পরিবর্তন করতে পারে। নীতি-সংস্করণ শব্দার্থবিদ্যা নিশ্চিত করে যে প্রশিক্ষণযোগ্য টোকেনগুলি তাদের আচরণ-নীতি লগ-সম্ভাব্যতা বজায় রাখে, একটি সিকোয়েন্স-লেভেল গেটের পিছনে প্রতি টোকেন অনুযায়ী অ্যাসিঙ্ক্রোনাস ব্যবহার সংশোধন করা হয়। ফরওয়ার্ড সামঞ্জস্য এর জন্য প্রয়োজন যে রোলআউট ইঞ্জিন এবং প্রশিক্ষণ অভিনেতা মডেল শব্দার্থে সম্মত হন।
বিশেষজ্ঞদের মিশ্রণের (MoE) নীতি এর জন্য শেষ পরিবর্তনটি সবচেয়ে গুরুত্বপূর্ণ, যা ক্রমবর্ধমান সাধারণ। রোলআউট এবং প্রশিক্ষণ রাউটারগুলি বিশেষজ্ঞদের স্বাধীনভাবে নির্বাচন করে, এবং ছোট সংখ্যাগত পার্থক্যগুলি টপ-কে পছন্দগুলিকে ফ্লিপ করতে পারে, যা নমুনা নেওয়া হয়েছিল এবং কী প্রশিক্ষণ দেওয়া হচ্ছে তার মধ্যে একটি অমিল তৈরি করে৷ মোল্ট এটিকে রোলআউট রাউটিং রিপ্লে দিয়ে সমাধান করে: ভিএলএলএম তার প্রতি-টোকেন বিশেষজ্ঞ আইডি ফেরত দেয় এবং প্রশিক্ষণ ফরোয়ার্ড পাস সেই সঠিক রাউটিং সিদ্ধান্তগুলিকে পুনরায় প্রাপ্ত করার পরিবর্তে পুনরায় প্লে করে।এটা কি জন্য
পাঠানো রেসিপি এবং ব্যবহারের কেসগুলি সেই দিকে নির্দেশ করে যেখানে NVIDIA আশা করে যে মোল্ট গ্রহণ করা হবে: মাল্টি-টার্ন টুল-ব্যবহারের এজেন্ট, কোড-এক্সিকিউশন এজেন্ট, দৃষ্টি-ভাষা পরিবেশ (ফ্রেমওয়ার্কটিতে একটি শিপড জিও 3 কে রেসিপি রয়েছে), এলএলএম-এজ-জজ রিওয়ার্ড লুপ, এবং অন-পলিসি মডেল স্টুডেন্টের জন্য একটি ছোট ডিস্টিলেশন। এইগুলি হল অবিকল কাজের চাপ যা সমগ্র শিল্প জুড়ে এজেন্টিক RL-এর বৃদ্ধিকে চালিত করেছে, এবং প্রত্যেকটি আংশিক-রোলআউট, অ্যাসিঙ্ক-স্যাম্পলিং শর্তগুলির অধীনে সঠিকভাবে পেতে কুখ্যাতভাবে স্থিরভাবে কাজ করে যা বাস্তব প্রশিক্ষণ আরোপ করে।
বৃহত্তর সংকেত হল যে NVIDIA শুধুমাত্র GPU গুলিতেই বিনিয়োগ করছে না যা এজেন্টদের প্রশিক্ষণ দেয় কিন্তু সফ্টওয়্যার স্ট্যাক গবেষকরা সেগুলি তৈরি করতে ব্যবহার করেন৷ কোডবেসটিকে ছোট এবং পঠনযোগ্য রেখে — এবং স্পষ্টভাবে এটিকে ডিজাইন করে যাতে একজন AI কোডিং সহকারী এটিকে সংশোধন করতে পারে — Molt একটি বাজি প্রতিফলিত করে যে এজেন্টিক RL টুলিংয়ের ভবিষ্যত এটি ব্যবহার করা মডেলগুলির সাথে সহ-বিকাশ করা হবে।
এআই থেকে এগিয়ে থাকুন
ফ্রন্টিয়ার এজেন্টদের কীভাবে প্রশিক্ষিত করা হয় সেই কাঠামোর পুনর্নির্মাণের বিষয়ে আরও জানতে, সর্বশেষ AI উন্নয়ন এর জন্য আমাদের হাব অনুসরণ করুন।
আরও এআই খবর পড়ুন →
