मेटा में एफएआईआर, ऑक्सफोर्ड विश्वविद्यालय और यूनिवर्सिटी कॉलेज लंदन की एक शोध टीम ने एआई रिसर्च प्रेफरेंस मॉडल (आरपीएम) पेश किया है, जो यह तय करने की एक विधि है कि एक स्वायत्त अनुसंधान एजेंट को वास्तव में कौन से मशीन लर्निंग प्रयोग चलाने चाहिए। यह अनुमान लगाने के बजाय कि कोई प्रयोग कैसे स्कोर करेगा, एक आरपीएम अप्रयुक्त उम्मीदवारों को रैंक करता है और सबसे आशाजनक को चुनता है, एक बदलाव टीम का कहना है कि एआई-संचालित अनुसंधान में वास्तविक बाधा को संबोधित करता है: कार्य पर मार्कटेकपोस्ट की रिपोर्ट के अनुसार सत्यापन गणना।

यह विचार ऐसे क्षण में आता है जब अनुसंधान एजेंट पहले से ही अपने स्वयं के प्रयोगों का प्रस्ताव, कार्यान्वयन और स्कोर कर सकते हैं। आइडिया जेनरेशन सस्ता है; क्रियान्वयन नहीं है. एक अकेले उम्मीदवार को प्रशिक्षित करने में घंटों से लेकर कई दिनों तक का GPU समय लग सकता है, इसलिए एक एजेंट अनिवार्य रूप से अपनी क्षमता से कहीं अधिक प्रयोगों का प्रस्ताव रखता है। जो उम्मीदवार निष्पादित होते हैं, वह अनुसंधान प्रगति पर वास्तविक लीवर होता है, जैसा कि टीम इसे तैयार करती है। प्रयोगशालाओं के लिए, जो अपने गणना बिलों में वृद्धि देख रहे हैं, यही फ़्रेमिंग है जिसके कारण यह कार्य अनुसंधान स्वचालन में नवीनतम एआई विकास पर ध्यान आकर्षित कर रहा है।

प्रयोग चयन बाधा क्यों है

टीम ने पाया कि भाषा मॉडल पूर्ण मेट्रिक्स या निष्पादन परिणामों की भविष्यवाणी करने में अविश्वसनीय हैं। एक मॉडल किसी उम्मीदवार के प्रयोग को नहीं देख सकता है और न ही उस स्कोर का सटीक अनुमान लगा सकता है जो उसे प्राप्त होगा। शोधकर्ताओं ने पाया कि यह क्या कर सकता है, यह तय करना है कि दो उम्मीदवारों में से कौन सा बेहतर दांव है - एक पूर्ण भविष्यवाणी के बजाय एक सापेक्ष तुलना। आरपीएम पूरी तरह से उस अंतर के आसपास बनाए गए हैं: वे कभी भी स्कोर का पूर्वानुमान नहीं लगाते हैं, वे केवल रैंक करते हैं।

सिस्टम एआईआरए-डोजो के अंदर चलता है, एक ओपन-सोर्स इवोल्यूशनरी ट्री सर्च स्कैफोल्ड जो लालची अभिभावक चयन और ड्राफ्ट, इम्प्रूव और डीबग ऑपरेटरों के माध्यम से मशीन लर्निंग प्रयोग उत्पन्न करता है, जो अंत में उच्चतम-सत्यापन-स्कोर नोड लौटाता है। बेंचमार्क, एआईआरएस-बेंच, भी खुला स्रोत है। मचान और वरीयता मॉडल दोनों अपनी रीढ़ की हड्डी के रूप में Qwen3.6-27B का उपयोग करते हैं, जिसे टीम नोट करती है कि यह खुला वजन है।

नॉकआउट टूर्नामेंट कैसे काम करता है

एक चाइल्ड प्रयोग उत्पन्न करने और उसे क्रियान्वित करने के बजाय, एजेंट 15 अप्रयुक्त उम्मीदवारों को तैयार करने के लिए समानांतर में 15 बार एक ऑपरेटर लागू करता है। फिर आरपीएम नॉकआउट टूर्नामेंट में उनकी जोड़ीवार तुलना करता है, और केवल विजेता को ही निष्पादित किया जाता है। प्रत्येक तुलना को खोजे गए पेड़ की चौड़ाई-पहली चाल से एकत्र किए गए संदर्भ नोड्स पर आधारित किया जाता है, जिसमें प्रत्येक उम्मीदवार को उसके पूर्वजों के सत्यापन स्कोर के साथ दिखाया जाता है, इसलिए न्यायाधीश शून्य के बजाय एजेंट के वास्तविक खोज इतिहास से तर्क करता है।

पेपर विभिन्न गणना बजटों के साथ दो प्रकारों का वर्णन करता है:

  • केवल अनुमान आरपीएम - एक न्यायाधीश के रूप में एलएलएम जो एक ही पास में उम्मीदवार की योजनाओं, कोड और खोज इतिहास की तुलना करता है। इसके प्रॉम्प्ट को DSPy फ्रेमवर्क से MIPROv2 के साथ अनुकूलित किया गया था और जिसे टीम प्रिंसिपल-इन्वेस्टिगेटर रूब्रिक कहती है, उस पर केंद्रित है: यह फिक्स करने योग्य बग को सहन करता है, एक्स्टेंसिबिलिटी को पुरस्कृत करता है और अनावश्यक अनुसंधान दिशाओं को दंडित करता है। ऑफ़लाइन तुलना सटीकता 57.7 से 59.0 प्रतिशत मापी गई।
  • एजेंट आरपीएम - वही जज प्लस एक सैंडबॉक्स जो एजेंट के वातावरण को क्लोन करता है, जिसमें एक एच200 जीपीयू भी शामिल है, जिसमें पायथन, बैश और एक सबमिट-सॉल्यूशन एक्शन तक सीमित उपकरण होते हैं। यह छोटे पैमाने पर पायलट प्रयोग चलाता है, फिर एक फीडबैक मॉडल या तो सबसे अधिक जानकारीपूर्ण अगले प्रयोग का प्रस्ताव करता है या लूप को समाप्त करता है। पायलटों को 60-सेकंड की सीमा के साथ 30 पर सीमित किया गया है, और शेष समय बजट को जानबूझकर बढ़ा-चढ़ाकर बताया गया है - वास्तविक 300 के मुकाबले 2,700 सेकंड की सूचना दी गई है - इसलिए एजेंट जल्दी अनुकूलन करना बंद नहीं करता है।

एक न्यायाधीश एक प्रमुख अन्वेषक की तरह ट्यून किया गया

प्रिंसिपल-अन्वेषक फ़्रेमिंग चुपचाप दिलचस्प हिस्सा है। अत्यधिक प्रभावशाली दिखने वाले उम्मीदवारों को पुरस्कृत करने के बजाय, अनुकूलित रूब्रिक यह दर्शाता है कि एक अनुभवी शोधकर्ता कैसे विचारों का परीक्षण करता है: बग कोड जिसे ठीक किया जा सकता है वह एक मृत अंत का पीछा करने वाले पॉलिश कोड को मात देता है, और मौजूदा पेड़ की नकल करने वाले निर्देश उपन्यासों की तुलना में कम मूल्य के होते हैं। टीम के निष्कर्षों से पता चलता है कि हैंड-ट्यूनिंग के बजाय त्वरित अनुकूलन के माध्यम से सीखा गया वह रूब्रिक ही सुधार लाता है।

एआईआरएस-बेंच पर बेंचमार्क परिणाम

मूल्यांकन में 20 सार्वजनिक पाठ और सारणीबद्ध कार्यों को शामिल किया गया, प्रत्येक कार्य को एक H200 और 10 यादृच्छिक बीजों पर 24 घंटे दिए गए। महत्वपूर्ण रूप से, एक ही Qwen3.6-27B बैकबोन प्रयोग ऑपरेटरों और वरीयता मॉडल दोनों को संचालित करता है, इसलिए लाभ एक मजबूत जज मॉडल के बजाय चयन परत से आता है। औसत सामान्यीकृत स्कोर:

  • कोई आरपीएम नहीं (यादृच्छिक चयन): 0.684
  • केवल अनुमान आरपीएम: 0.711
  • एजेंटिक आरपीएम: 0.729
  • मान्यता दैवज्ञ (छत): 0.748
  • परीक्षण दैवज्ञ (छत): 0.759

यादृच्छिक चयन पर सुधार की संभावना केवल अनुमान संस्करण के लिए 0.5923 और एजेंटिक के लिए 0.5913 थी, 95 प्रतिशत विश्वास अंतराल के साथ 0.5066 और 0.5018 की निचली सीमा - सांख्यिकीय महत्व के लिए 0.5 सीमा से ऊपर, हालांकि टीम स्पष्ट है कि मार्जिन परिवर्तनकारी के बजाय मामूली है।

दक्षता अधिक व्यावहारिक परिणाम है. केवल-अनुमान आरपीएम 14.88 घंटों में यादृच्छिक बेसलाइन के अंतिम स्कोर 0.684 तक पहुंच गया, जो 1.61x स्पीडअप था, जबकि एजेंटिक संस्करण को 15.50 घंटे, 1.55x स्पीडअप की आवश्यकता थी। यहां तक ​​कि स्व-होस्टेड जज अनुमान के ओवरहेड को ध्यान में रखते हुए, समायोजित संख्याएं अनुकूल रहीं।

खुले वज़न और ईमानदार चेतावनियाँ

टीम स्पष्ट रूप से कहती है कि आरपीएम आज केवल आंशिक रूप से ही तैनात किए जा सकते हैं। घटक खुले हैं - बिना किसी फाइन-ट्यूनिंग के जमे हुए पूर्व-प्रशिक्षित बैकबोन, एक ओपन-सोर्स मचान और बेंचमार्क, और ओपन-वेट बैकबोन मॉडल - लेकिन एजेंटिक वेरिएंट की सैंडबॉक्स आवश्यकता और इसके पायलट-प्रयोग ओवरहेड का मतलब है कि अधिकांश प्रयोगशालाएं केवल अनुमान संस्करण के साथ शुरू होंगी। शोधकर्ताओं ने यह भी ध्यान दिया कि डिबग चरण एजेंटिक संस्करण में यादृच्छिक चयन पर वापस आते हैं क्योंकि पायलट समय एजेंट की अपनी घड़ी के साथ प्रतिस्पर्धा करता है।

बड़ा महत्व दिशात्मक हो सकता है। जैसे-जैसे स्वायत्त अनुसंधान एजेंट औद्योगिक प्रयोगशालाओं में डेमो से दैनिक उपयोग की ओर बढ़ते हैं, दुर्लभ संसाधन अब विचार नहीं बल्कि जीपीयू घंटे और विधियां हैं जो समय के साथ एक निश्चित गणना बजट परिसर से अधिक प्रगति को निचोड़ते हैं। दौड़ने से पहले रैंकिंग करना एक सरल विचार है, और एआईआरएस-बेंच संख्याएं बताती हैं कि यह एक ऐसा विचार है जो काफी मायने रखता है।

एआई से आगे रहें

एआई बज़ वायर पर भविष्य के मॉडलों को आकार देने वाले शोध से जुड़े रहें। अधिक AI समाचार पढ़ें →