Η ομάδα NeMo της NVIDIA κυκλοφόρησε το Molt, ένα εγγενές πλαίσιο PyTorch για εκμάθηση ενίσχυσης με έναν ασυνήθιστο στόχο σχεδιασμού: μια βάση κώδικα αρκετά μικρή ώστε ένας ερευνητής να μπορεί να την κρατήσει στο κεφάλι του — και ένας βοηθός κωδικοποίησης AI να μπορεί να το διαβάσει και να το αιτιολογήσει στο σύνολό του. Η έκδοση προσγειώνεται καθώς το agent RL γίνεται η κυρίαρχη συνταγή για τη διδασκαλία μοντέλων για τη χρήση εργαλείων, τη σύνταξη κώδικα και την πλοήγηση σε περιβάλλοντα, και είναι ένα από τα πολλά έργα υποδομής που αναδιαμορφώνουν τον τρόπο με τον οποίο εκπαιδεύονται οι συνοριακοί πράκτορες. Καλύπτουμε αυτές τις αλλαγές στις [ενημερωτικές ειδήσεις AI] (https://aibuzzwire.news).

Κατασκευάστηκε για να διαβάζεται, όχι απλώς να τρέχει

Όπως αναφέρει το MarkTechPost, το Molt μετρά χονδρικά 8,6.000 γραμμές κωδικού RL, που υπολογίζονται ανιχνεύοντας το γράφημα εισαγωγής από το σημείο εισόδου RL κάθε πλαισίου. Η ίδια μέθοδος καταγράφει περίπου 62K γραμμές για το verl, 25K για το slime και 7,2K για το OpenRLHF. Αυτή η σκόπιμη συμπαγής είναι το κεντρικό βήμα του έργου: η agentical RL έρευνα είναι η συνεχής τροποποίηση αλγορίθμων - νέοι εκτιμητές, νέα στάδια αγωγών, νέα σχήματα διάθεσης - και σε mainstream πλαίσια κάθε αλλαγή νημάτων περνά μέσα από στρώματα εκπαιδευτή, διανεμημένης υποστήριξης και κόλλας ανάπτυξης. Το Molt στοχεύει να αφαιρέσει αυτή την τριβή.

Το πλαίσιο έχει άδεια χρήσης Apache 2.0 και αποστέλλεται με κωδικούς εκκίνησης, σενάρια Slurm και προκατασκευασμένο κοντέινερ. Η NVIDIA είναι σαφές, ωστόσο, ότι το συνοδευτικό ερευνητικό έγγραφο τοποθετεί τη Molt ως ερευνητική υποδομή και όχι ως υπηρεσία εκπαίδευσης παραγωγής, και το υλικό είναι ο πραγματικός φύλακας. Οι συνταγές που αποστέλλονται προϋποθέτουν 2 κόμβους των 8 GPU H100, χωρίζονται 8 για εκπαίδευση και 8 για διάθεση. Αυτό το φέρνει σε κοντινή απόσταση από συνοριακά και παρακείμενα εργαστήρια, καλά χρηματοδοτούμενες νεοσύστατες επιχειρήσεις που κάνουν μετεκπαίδευση, επιχειρηματικές ερευνητικές ομάδες τεχνητής νοημοσύνης και ακαδημαϊκές ομάδες με πρόσβαση πολλαπλών κόμβων H100 ή H200.

Σύνθεση, όχι διχαλωτό

Η αρχιτεκτονική του Molt συνθέτει τρία υπάρχοντα εργαλεία χωρίς να διχάσετε κανένα από αυτά, έτσι οι βελτιώσεις στο upstream φτάνουν ως καρφίτσα κοντέινερ και όχι ως επώδυνη επαναφορά. Χρησιμοποιεί Ray για τοποθέτηση και ασύγχρονες ουρές, vLLM για διάθεση και NVIDIA AutoModel με FSDP2 για εκπαίδευση. Ο χρόνος εκτέλεσης αποτελείται από μια ομάδα πρακτόρων, ένα σύνολο κινητήρων vLLM πίσω από έναν δρομολογητή αιτήματος και έναν ενιαίο παράγοντα πολιτικής που μπορεί να εκπαιδευτεί. Μια δεξαμενή ροής κρατά τις άμεσες ομάδες εν πτήσει, έτσι ώστε οι κινητήρες να μην αδειάζουν ποτέ ενώ ο ηθοποιός προπονείται.

Ένα χαρακτηριστικό που ονομάζεται μερική διάθεση είναι κεντρικής σημασίας για την αποτελεσματικότητα. Όταν ενημερώνεται η πολιτική, το Molt θέτει σε παύση τους κινητήρες, μεταδίδει τα ενημερωμένα θραύσματα του ηθοποιού μέσω NCCL απευθείας σε κάθε κινητήρα και συνεχίζει τα διατηρημένα αιτήματα αντί να τα απορρίπτει. Αυτό αποφεύγει το άχρηστο μοτίβο της απόρριψης των σε εξέλιξη λανσαρίσματα κάθε φορά που αλλάζει το μοντέλο.

Μία ενότητα, δύο φόρμες αντιπροσώπων

Μια RL που εκτελείται στο Molt ονομάζει μια μεμονωμένη λειτουργική μονάδα Python που εξάγει ένα AgentRunner και οτιδήποτε άλλο — συμπεριλαμβανομένης της συνάρτησης ανταμοιβής — είναι συνηθισμένος κώδικας. Το πλαίσιο υποστηρίζει δύο μορφές. Με το Env, το πλαίσιο κατέχει τον βρόχο LLM μέσα σε ένα "step()" ευθυγραμμισμένο με το Gymnasium, το οποίο ταιριάζει στο γνωστό μοτίβο ενίσχυσης-μάθησης. Με το ChatAgent, ο χρήστης κατέχει τον βρόχο μέσω ενός αποθέματος OpenAI ή Anthropic SDK, καθιστώντας εύκολη την αναδίπλωση ενός υπάρχοντος πράκτορα.

Για να γεφυρώσει και τα δύο, η Molt εκκινεί έναν διακομιστή loopback που εκφωνεί και τα δύο πρωτόκολλα καλωδίων και κάθε αίτημα αποκωδικοποιείται από την πλευρά του διακομιστή σε μια συσσώρευση ακριβούς διακριτικού. Όταν ένας πράκτορας μεγάλου ορίζοντα συμπυκνώνει το περιβάλλον του και ξαναγράφει το πρόθεμα - μια κοινή λειτουργία για πράκτορες που εκτελούνται για πολλές στροφές - ο διακομιστής σφραγίζει το τρέχον τμήμα και ανοίγει ένα νέο αυτόματα. Αυτό είναι το είδος της λεπτομέρειας υδραυλικών εγκαταστάσεων που καθορίζει εάν μια εκτέλεση πρακτορείου RL είναι σωστή στην πράξη ή απλώς φαίνεται σωστή.

Τρεις αμετάβλητες ορθότητας

Ο σχεδιασμός του Molt είναι οργανωμένος γύρω από τρεις αμετάβλητες ορθότητες που αντιμετωπίζουν τις λεπτές αποτυχίες της ασύγχρονης εκπαίδευσης πρακτόρων. Ταυτότητα διακριτικού σημαίνει ότι τα αναγνωριστικά διακριτικών δειγματοληψίας καθορίζουν την τροχιά, όχι μια επαναληπτική μεταγραφή — σημαντική επειδή η συρραφή κειμένου σε διακριτικά μπορεί να αλλάξει σιωπηλά τα δεδομένα. Η Σημασιολογία έκδοσης πολιτικής διασφαλίζει ότι τα εκπαιδεύσιμα διακριτικά διατηρούν τις πιθανότητες καταγραφής συμπεριφοράς-πολιτικής, με ασύγχρονη χρήση διορθωμένη ανά διακριτικό πίσω από μια πύλη σε επίπεδο ακολουθίας. Η μπροστινή συνοχή απαιτεί ο κινητήρας εκκίνησης και ο εκπαιδευτικός παράγοντας να συμφωνούν σχετικά με τη σημασιολογία του μοντέλου.

Αυτό το τελευταίο αμετάβλητο έχει μεγαλύτερη σημασία για τις πολιτικές μείγματος εμπειρογνωμόνων (MoE), οι οποίες είναι ολοένα και πιο κοινές. Οι δρομολογητές διάθεσης και εκπαίδευσης επιλέγουν τους ειδικούς ανεξάρτητα και οι μικρές αριθμητικές διαφορές μπορούν να ανατρέψουν τις κορυφαίες επιλογές, δημιουργώντας μια αναντιστοιχία μεταξύ αυτού που δειγματοληψία και αυτού στο οποίο εκπαιδεύεται. Το Molt το αντιμετωπίζει αυτό με επαναπαραγωγή δρομολόγησης: το vLLM επιστρέφει τα αναγνωριστικά εμπειρογνωμόνων ανά διακριτικό και το εκπαιδευτικό πάσο προς τα εμπρός αναπαράγει αυτές τις ακριβείς αποφάσεις δρομολόγησης αντί να τις επαναλαμβάνει.

Για ποιο σκοπό είναι

Οι συνταγές και οι περιπτώσεις χρήσης που αποστέλλονται υποδεικνύουν το σημείο όπου η NVIDIA αναμένει την υιοθέτηση του Molt: πράκτορες χρήσης εργαλείων πολλαπλών στροφών, παράγοντες εκτέλεσης κώδικα, περιβάλλοντα γλώσσας όρασης (το πλαίσιο περιλαμβάνει μια αποστολή geo3k συνταγή), βρόχους ανταμοιβής LLM-as-judge και απόσταξη πολιτικής σε μικρότερο μοντέλο μαθητή. Αυτοί είναι ακριβώς οι φόρτοι εργασίας που οδήγησαν το κύμα του πρακτορείου RL σε ολόκληρο τον κλάδο, και το καθένα είναι γνωστό ότι τα καταφέρνει με δυσκολία κάτω από τις συνθήκες μερικής διάθεσης, ασύγχρονης δειγματοληψίας που επιβάλλει η πραγματική εκπαίδευση.

Το ευρύτερο σήμα είναι ότι η NVIDIA επενδύει όχι μόνο στις GPU που εκπαιδεύουν τους πράκτορες, αλλά στη στοίβα λογισμικού που χρησιμοποιούν οι ερευνητές για την κατασκευή τους. Διατηρώντας τη βάση κωδικών μικρή και ευανάγνωστη - και σχεδιάζοντάς την ρητά έτσι ώστε ένας βοηθός κωδικοποίησης AI να μπορεί να την τροποποιήσει - η Molt αντικατοπτρίζει ένα στοίχημα ότι το μέλλον του agentic RL tooling θα αναπτυχθεί από κοινού με τα μοντέλα που το χρησιμοποιούν.

Μείνετε μπροστά από την τεχνητή νοημοσύνη

Για περισσότερα σχετικά με τα πλαίσια που αναδιαμορφώνουν τον τρόπο με τον οποίο εκπαιδεύονται οι συνοριακοί πράκτορες, ακολουθήστε το κέντρο μας για τις πιο πρόσφατες εξελίξεις AI.

Διαβάστε περισσότερα νέα AI →