सकाना एआई ने मशीन लर्निंग रिसर्च (टीएमएलआर) जर्नल में ट्रांजेक्शन्स ऑन मशीन लर्निंग रिसर्च (टीएमएलआर) जर्नल में एक शोध पत्र "बियॉन्ड इमिटेशन" प्रकाशित किया है, जिसमें मानव समीक्षाओं की नकल के बजाय त्रुटि का पता लगाने के लिए निर्मित एलएलएम-सहायता प्राप्त सहकर्मी समीक्षा प्रणाली का वर्णन किया गया है, जैसा कि मार्कटेकपोस्ट ने 10 अक्टूबर को रिपोर्ट किया था। टोक्यो स्थित प्रयोगशाला ने केंद्रीय प्रश्न का उत्तर देने के लिए कहा: एआई समीक्षक को ग्रेड देने के बजाय कि उसका आउटपुट मानव समीक्षाओं से कितनी निकटता से मेल खाता है, क्या यह एक अंतर्निहित गलती ढूंढ सकता है?
टीम ने दो कलाकृतियाँ भेजीं: त्रुटि का पता लगाने को मापने के लिए एक विरोधाभास बेंचमार्क, और एक मल्टी-लेयर रिव्यू (एमएलआर) प्रणाली जिसने प्रत्येक बेसलाइन का परीक्षण किया। सहकर्मी समीक्षा को बढ़ावा देने के लिए एआई का उपयोग करने में बढ़ती रुचि के बीच ये नतीजे सामने आए हैं - यह एक ऐसी प्रक्रिया है जो सबमिशन की बढ़ती मात्रा के कारण दबाव में है। एआई कैसे अनुसंधान को नया आकार दे रहा है, इस बारे में अधिक जानकारी के लिए हमारे नवीनतम एआई विकास को फॉलो करें।
रोपित गलतियों का एक बेंचमार्क
विरोधाभास बेंचमार्क त्रुटियों को वास्तविक कागजात में डालता है और जांचता है कि समीक्षक उन्हें पकड़ते हैं या नहीं। शोधकर्ताओं ने ACL, AISTATS, CVPR, और ICML 2025, साथ ही NeurIPS 2024 से 257 CC-लाइसेंस प्राप्त पेपर एकत्र किए, फिर प्रत्येक पेपर के दावों, सबूतों और तरीकों का ज्ञान ग्राफ बनाने के लिए जेमिनी 2.5 प्रो का उपयोग किया।
गंभीरता को संरचनात्मक रूप से परिभाषित किया गया है: पेपर के "मुख्य दावे" से एक नोड की दूरी यह निर्धारित करती है कि त्रुटि कितनी केंद्रीय है। दूरी शून्य एक मूल दावे को प्रभावित करती है; बड़ी दूरी सहायक विवरणों को प्रभावित करती है। GPT-4.1 फिर प्रति दूरी एक नोड को एक विरोधाभास में फिर से लिखता है, जिससे कुल 1,164 डेटा पॉइंट बनते हैं। एक o3 जज प्रत्येक समीक्षा को दस बार स्कोर करता है। साफ कागजों पर न्यायाधीश 99.9% सटीकता तक पहुंच गया, और मैन्युअल रूप से पुष्टि किए गए कैच पर इसने 86.8% संवेदनशीलता दिखाई - जिसका अर्थ है कि रिपोर्ट किए गए पहचान स्कोर वास्तव में रूढ़िवादी हो सकते हैं।
बहुस्तरीय समीक्षा कैसे काम करती है
एमएलआर एक एजेंटिक प्रणाली है जो किसी पेपर की आलोचना करने से पहले उसे समझती है, इसे ऑफ-द-शेल्फ क्लाउड मॉडल पर चलने वाले तीन विशेष एजेंटों से इकट्ठा किया गया है - कोई जीपीयू क्लस्टर नहीं और कोई फाइन-ट्यूनिंग की आवश्यकता नहीं है:
- परिशिष्ट एजेंट (क्लाउड हाइकू 3.5): परिशिष्ट से प्रयोगों और कार्यान्वयन विवरणों का सारांश देता है।
- साहित्य समीक्षा एजेंट (क्लाउड सॉनेट 4, वैकल्पिक): पिछले काम के संदर्भ में पेपर रखने के लिए वेब खोज का उपयोग करता है।
- रिव्यू एजेंट (क्लाउड सॉनेट 4): कंप्यूटर वैज्ञानिक एस. केशव के सुप्रसिद्ध "थ्री-पास अप्रोच" से प्रेरित एक थ्री-पास प्रॉम्प्ट श्रृंखला चलाता है - पहले एक उच्च-स्तरीय रूपरेखा, फिर कमजोरियों, धारणाओं और कमियों को चिह्नित करने वाला एक विस्तृत अध्ययन, और अंत में सभी एजेंट आउटपुट को ताकत, कमजोरियों, प्रश्नों, एक सिफारिश, एक स्कोर और एक कार्य सूची में विलय कर देता है।
पीडीएफ सीधे मॉडलों को भेजा जाता है, इसलिए आंकड़े और समीकरण प्रसंस्करण से बचे रहते हैं। सिस्टम मुख्य पाठ के 10 पृष्ठों तक पढ़ता है, और सकाना प्रति समीक्षा लागत लगभग $0.47 का अनुमान लगाता है।
परिणाम: डिज़ाइन और मॉडल चयन दोनों मायने रखते हैं
एमएलआर ने बेंचमार्क पर परीक्षण की गई सभी चार प्रणालियों का नेतृत्व किया। चार स्वतंत्र समीक्षाओं के साथ, इसने 73.43% मूल-दावा (दूरी-शून्य) विरोधाभासों और कुल मिलाकर 40.95% को पकड़ा। सबसे अच्छी आधार रेखा, एजेंटरिव्यू नामक प्रणाली, मुख्य दावों पर केवल 14.81% प्रबंधित करती है। यहां तक कि एक एमएलआर समीक्षा में भी 60.79% कोर-क्लेम त्रुटियां पकड़ी गईं।
एक एब्लेशन अध्ययन मॉडल की पसंद से डिजाइन के योगदान को अलग करता है। मौजूदा समीक्षा पाइपलाइन के अंदर क्लाउड सॉनेट 4 के लिए जीपीटी-4.1 की अदला-बदली से कोर-क्लेम डिटेक्शन 14.56% से बढ़कर 35.40% हो गया, जबकि एमएलआर के मल्टी-एजेंट डिज़ाइन ने एकल समीक्षा के लिए शीर्ष पर लगभग 25 प्रतिशत अंक जोड़े। जैसे-जैसे त्रुटियाँ मुख्य दावे से दूर होती जाती हैं, पता लगाने की सटीकता कम होती जाती है, जिसके बारे में लेखकों का कहना है कि यह गंभीरता स्कोरिंग का समर्थन करता है।
गंदे, वास्तविक दुनिया के डेटा पर तस्वीर धुंधली हो जाती है। विदड्रारएक्सिव-चेक पर, 211 वास्तव में वापस लिए गए आर्क्सिव कागजात का एक सेट, एमएलआर ने "समान" मैचों पर 26.07% और सटीक मैचों पर 16.11% स्कोर किया - और सिस्टम पांडुलिपि पाठ में लगाए गए छिपे हुए त्वरित इंजेक्शन के प्रति असुरक्षित बना हुआ है। दूसरे शब्दों में, वास्तविक वापस लिए गए दस्तावेज़ों को पढ़ना, सिंथेटिक विरोधाभासों को पकड़ने से कहीं अधिक कठिन है।
सहकर्मी समीक्षा के लिए इसका क्या अर्थ है
अध्ययन का सबसे व्यावहारिक निष्कर्ष इसका कम से कम ग्लैमरस हो सकता है: सिस्टम डिज़ाइन और मॉडल विकल्प दोनों ही त्रुटि का पता लगाने में महत्वपूर्ण भूमिका निभाते हैं, और समीक्षक जो निर्णय लेने से पहले पढ़ते हैं, उन्हें मानव समीक्षा पाठ पर पैटर्न-मिलान वाली त्रुटियों की तुलना में कहीं अधिक गंभीर त्रुटियां मिलती हैं। यह अंतर मायने रखता है क्योंकि एआई-सहायक समीक्षा पर अधिकांश पूर्व कार्य मानवीय निर्णयों के साथ समझौते के लिए अनुकूलित किए गए हैं - एक मीट्रिक जो वास्तविक जांच के बजाय आत्मविश्वास से भरी अनुरूपता को पुरस्कृत करता है।
सकाना के नतीजे यह नहीं बताते हैं कि एआई मानव रेफरी को बदलने के लिए तैयार है - एक ऐसी प्रणाली जो वास्तविक वापस लिए गए कागजात पर अधिकांश त्रुटियों को छोड़ देती है और एम्बेडेड संकेतों द्वारा हेरफेर किया जा सकता है, उसे एक सहायक परत के रूप में माना जाता है, न कि एक प्राधिकरण के रूप में। बेंचमार्क की सिंथेटिक त्रुटियां सांख्यिकीय अस्पष्टताओं और विवादित व्याख्याओं की तुलना में भी साफ हैं जो सहकर्मी समीक्षा में वास्तविक असहमति पर हावी हैं, इसलिए लगाए गए विरोधाभासों पर प्रदर्शन को एक सीमा के रूप में पढ़ा जाना चाहिए, न कि एक वादे के रूप में।
लेकिन लगभग $0.47 प्रति समीक्षा पर, परीक्षण किए गए किसी भी सिस्टम की उच्चतम त्रुटि-पहचान दर के साथ, एमएलआर एक निकट अवधि की ओर इशारा करता है जहां एआई समीक्षक विरोधाभासों के लिए पहली-पास स्क्रीन को संभालते हैं जबकि मानव समीक्षक निर्णय कॉल पर ध्यान केंद्रित करते हैं जो मशीनें अभी भी नहीं कर सकती हैं। एलएलएम-सहायता समीक्षा के साथ प्रयोग करने वाले पत्रिकाओं और सम्मेलन आयोजकों के पास अब अपने स्वयं के सिस्टम को मापने के लिए एक सार्वजनिक बेंचमार्क और एक मजबूत आधार रेखा दोनों हैं - और, यदि 73.43% और 14.81% के बीच का अंतर रहता है, तो एक स्पष्ट संकेत है कि रीडिंग आर्किटेक्चर कच्चे मॉडल के आकार से अधिक मायने रखता है।
---
एआई से आगे रहेंनवीनतम एआई समाचार, विश्लेषण और सफलताएँ प्राप्त करें - सभी एक ही स्थान पर।
अधिक AI समाचार पढ़ें →