मेटा, ऑक्सफर्ड युनिव्हर्सिटी आणि युनिव्हर्सिटी कॉलेज लंडन येथील FAIR मधील संशोधन पथकाने AI रिसर्च प्रेफरन्स मॉडेल्स (RPMs) सादर केले आहेत, जी एक स्वायत्त संशोधन एजंटने कोणते मशीन लर्निंग प्रयोग प्रत्यक्षात चालवायचे हे ठरवण्याची एक पद्धत आहे. एखादा प्रयोग कसा स्कोअर करेल याचा अंदाज घेण्याऐवजी, RPM न चालवलेल्या उमेदवारांची रँक करते आणि सर्वात आशादायक उमेदवार निवडते, टीम म्हणते की AI-चालित संशोधनातील खरी अडचण दूर करते: सत्यापन गणना, मार्कटेक पोस्टच्या कामावरील अहवालानुसार.

कल्पना अशा क्षणी येते जेव्हा संशोधन एजंट आधीच त्यांचे स्वतःचे प्रयोग प्रस्तावित करू शकतात, अंमलबजावणी करू शकतात आणि गुण मिळवू शकतात. कल्पना निर्मिती स्वस्त आहे; अंमलबजावणी नाही. एका उमेदवाराला प्रशिक्षण देण्यासाठी काही तासांपासून ते काही दिवसांचा GPU वेळ खर्च होऊ शकतो, त्यामुळे एजंट अपरिहार्यपणे चालवण्यास परवडेल त्यापेक्षा कितीतरी जास्त प्रयोगांचा प्रस्ताव देतो. कोणते उमेदवार कार्यान्वित होतात, ते कार्यसंघाने तयार केल्यामुळे, संशोधनाच्या प्रगतीचा खरा लीव्हर आहे. प्रयोगशाळांसाठी त्यांची गणना बिले चढताना पाहत आहेत, हे कार्य संशोधन ऑटोमेशनमधील नवीनतम AI घडामोडींवर लक्ष वेधून घेत आहे.

प्रयोग निवड ही अडचण का आहे

संघाला असे आढळले की भाषा मॉडेल परिपूर्ण मेट्रिक्स किंवा अंमलबजावणी परिणामांचा अंदाज लावण्यासाठी अविश्वसनीय आहेत. मॉडेल उमेदवाराच्या प्रयोगाकडे पाहू शकत नाही आणि तो किती गुण मिळवेल याचा अचूक अंदाज लावू शकत नाही. हे काय करू शकते, संशोधकांना आढळले की, दोन उमेदवारांपैकी कोणता उमेदवार अधिक चांगला आहे याचा न्याय केला जातो - निरपेक्ष अंदाजाऐवजी सापेक्ष तुलना. RPM पूर्णपणे त्या फरकाभोवती तयार केले जातात: ते कधीही स्कोअरचा अंदाज लावत नाहीत, ते फक्त रँक करतात.

प्रणाली AIRA-dojo मध्ये चालते, एक मुक्त-स्रोत उत्क्रांती ट्री शोध स्कॅफोल्ड जो लोभी पालक निवड आणि मसुदा, सुधारणे आणि डीबग ऑपरेटरद्वारे मशीन शिक्षण प्रयोग व्युत्पन्न करते, शेवटी सर्वोच्च-प्रमाणीकरण-स्कोअर नोड परत करते. बेंचमार्क, AIRS-Bench, देखील मुक्त स्रोत आहे. स्कॅफोल्ड आणि प्राधान्य मॉडेल दोन्ही Qwen3.6-27B त्यांचा पाठीचा कणा म्हणून वापरतात, जे टीमने लक्षात घेतले की ओपन वेट आहे.

नॉकआउट स्पर्धा कशी चालते

एक मूल प्रयोग तयार करून ते कार्यान्वित करण्याऐवजी, एजंट एका ऑपरेटरला 15 वेळा समांतरपणे 15 कार्य न केलेले उमेदवार तयार करण्यासाठी लागू करतो. RPM नंतर नॉकआऊट टूर्नामेंटमध्ये त्यांची जोडीने तुलना करते आणि फक्त विजेत्यालाच अंमलात आणले जाते. प्रत्येक तुलना एक्सप्लोर केलेल्या झाडाच्या रुंदी-प्रथम चालाद्वारे गोळा केलेल्या संदर्भ नोड्सवर आधारित आहे, ज्यामध्ये प्रत्येक उमेदवार त्याच्या पूर्वजांच्या प्रमाणीकरण स्कोअरसह दर्शविला जातो, त्यामुळे न्यायाधीश व्हॅक्यूम ऐवजी एजंटच्या वास्तविक शोध इतिहासावरून कारणे काढतात.

पेपर भिन्न गणना बजेटसह दोन प्रकारांचे वर्णन करतो:

  • फक्त-अनुमान RPM — एक LLM-जज-जज जो उमेदवार योजना, कोड आणि शोध इतिहासाची एकाच पासमध्ये तुलना करतो. त्याची प्रॉम्प्ट DSPy फ्रेमवर्क मधून MIPROv2 सह ऑप्टिमाइझ केली गेली आणि टीम ज्याला प्रिन्सिपल-इन्व्हेस्टिगेटर रुब्रिक म्हणते त्यावर एकत्रित केले: ते निराकरण करण्यायोग्य बग सहन करते, विस्तारितता बक्षीस देते आणि अनावश्यक संशोधन दिशानिर्देशांना दंड करते. ऑफलाइन तुलना अचूकता 57.7 ते 59.0 टक्के मोजली गेली.
  • एजंटिक RPM — समान न्यायाधीश आणि एक सँडबॉक्स जो एजंटचे वातावरण क्लोन करतो, सिंगल H200 GPU सह, Python, Bash आणि सबमिट-सोल्यूशन कृतीपर्यंत मर्यादित टूल्ससह. हे लहान-प्रमाणात पायलट प्रयोग चालवते, त्यानंतर फीडबॅक मॉडेल एकतर सर्वात माहितीपूर्ण पुढील प्रयोग प्रस्तावित करते किंवा लूप संपवते. वैमानिकांना 60-सेकंद थ्रेशोल्डसह 30 पर्यंत मर्यादित केले जाते आणि उर्वरित वेळेचे बजेट जाणूनबुजून अतिरंजित केले जाते — वास्तविक 300 च्या तुलनेत 2,700 सेकंद नोंदवले जातात — त्यामुळे एजंट लवकर ऑप्टिमाइझ करणे थांबवत नाही.

एक न्यायाधीश मुख्य अन्वेषकाप्रमाणे ट्यून करतात

प्रिन्सिपल-इन्व्हेस्टिगेटर फ्रेमिंग हा शांतपणे मनोरंजक भाग आहे. जास्तीत जास्त प्रभावशाली दिसणाऱ्या उमेदवारांना बक्षीस देण्याऐवजी, अनुभवी संशोधक कल्पनांचा कसा प्रयत्न करतात हे ऑप्टिमाइझ केलेले रूब्रिक प्रतिबिंबित करतात: बग्गी कोड ज्याला निश्चित केले जाऊ शकते असे बीट्स पॉलिश कोड डेड एंडचा पाठपुरावा करत आहे आणि सध्याच्या झाडाची नक्कल करणारे दिशानिर्देश कादंबरीपेक्षा कमी आहेत. हे रुब्रिक, हँड-ट्यूनिंग ऐवजी त्वरित ऑप्टिमायझेशनद्वारे शिकले गेले आहे, त्यातच सुधारणा होते, असे संघाचे स्पष्टीकरण सूचित करते.

AIRS-बेंचवर बेंचमार्क निकाल

मूल्यमापनामध्ये 20 सार्वजनिक मजकूर आणि सारणीबद्ध कार्ये समाविष्ट आहेत, प्रत्येक कार्याला 24 तास एकाच H200 आणि 10 यादृच्छिक सीड्सवर दिले आहेत. निर्णायकपणे, त्याच Qwen3.6-27B बॅकबोनने प्रयोग ऑपरेटर आणि प्राधान्य मॉडेल या दोन्हींना शक्ती दिली, त्यामुळे नफा अधिक मजबूत न्यायाधीश मॉडेलऐवजी निवड स्तरातून मिळतात. सरासरी सामान्यीकृत स्कोअर:

  • RPM नाही (यादृच्छिक निवड): 0.684
  • फक्त-अनुमान RPM: 0.711
  • एजंटिक RPM: 0.729
  • प्रमाणीकरण ओरॅकल (सीलिंग): 0.748
  • चाचणी ओरॅकल (सीलिंग): 0.759

यादृच्छिक निवडीवरील सुधारणेची संभाव्यता केवळ अनुमानासाठी 0.5923 आणि एजंटिकसाठी 0.5913 होती, 0.5066 आणि 0.5018 च्या 95 टक्के आत्मविश्वास मध्यांतर कमी मर्यादांसह - सांख्यिकीय 0.5 थ्रेशोल्डच्या वर, जरी सांख्यिकीपेक्षा मार्जिनचे महत्त्व आहे. परिवर्तनकारी

कार्यक्षमता हा अधिक व्यावहारिक परिणाम आहे. केवळ अनुमानानुसार RPM ने 14.88 तासांत 0.684 च्या यादृच्छिक बेसलाइनचा अंतिम स्कोअर गाठला, एक 1.61x स्पीडअप, तर एजंटिक व्हेरियंटला 15.50 तास, 1.55x स्पीडअप आवश्यक आहे. स्वयं-होस्टेड न्यायाधीश अनुमानाच्या ओव्हरहेडसाठी देखील, समायोजित संख्या अनुकूल राहिली.

खुले वजन आणि प्रामाणिक सावधगिरी बाळगा

आज RPM फक्त अंशतः उपयोजित करण्यायोग्य आहेत हे टीमला स्पष्ट आहे. घटक खुले आहेत — गोठलेले पूर्वप्रशिक्षित पाठीचा कणा ज्यामध्ये फाइन-ट्यूनिंग नाही, एक ओपन-सोर्स स्कॅफोल्ड आणि बेंचमार्क, आणि ओपन-वेट बॅकबोन मॉडेल्स — परंतु एजंटिक व्हेरियंटची सँडबॉक्स आवश्यकता आणि त्याचे पायलट-प्रयोग ओव्हरहेड याचा अर्थ बहुतेक लॅब केवळ अनुमानाच्या आवृत्तीसह सुरू होतील. संशोधकांनी हे देखील लक्षात घेतले की डीबग पायऱ्या एजंटिक प्रकारातील यादृच्छिक निवडीकडे परत येतात कारण पायलट वेळ एजंटच्या स्वतःच्या घड्याळाशी स्पर्धा करते.

मोठे महत्त्व दिशात्मक असू शकते. स्वायत्त संशोधन एजंट डेमोमधून औद्योगिक प्रयोगशाळांमध्ये दैनंदिन वापराकडे जात असताना, दुर्मिळ संसाधन यापुढे कल्पना नसून GPU तास आणि पद्धती आहेत ज्या कालांतराने निश्चित गणना बजेट कंपाऊंडमधून अधिक प्रगती करतात. धावण्यापूर्वी क्रमवारी लावणे ही एक सोपी कल्पना आहे आणि AIRS-बेंच क्रमांक सूचित करतात की ही एक कल्पना आहे जी महत्त्वाची ठरेल.

एआयच्या पुढे राहा

AI Buzz Wire वर उद्याच्या मॉडेलला आकार देणारे संशोधन चालू ठेवा. अधिक एआय बातम्या वाचा →