Sakana AI ने ट्रान्झॅक्शन्स ऑन मशीन लर्निंग रिसर्च (टीएमएलआर) जर्नलमध्ये "बियॉन्ड इमिटेशन" हा शोधनिबंध प्रकाशित केला आहे, ज्यामध्ये मानवी पुनरावलोकनांचे अनुकरण करण्याऐवजी त्रुटी शोधण्याच्या आसपास तयार केलेल्या एलएलएम-सहायक पीअर रिव्ह्यू सिस्टमचे वर्णन केले आहे, मार्कटेकपोस्टने 10 ऑक्टोबर रोजी नोंदवले. टोकियो-आधारित एआयच्या क्लोज रिव्ह्यूवर आधारित प्रश्न: टोकियो-आधारित रिव्ह्यू कसे सोडवायचे? त्याचे आउटपुट मानवी समीक्षेशी जुळते, त्यात लावलेली चूक सापडते का?
टीमने दोन कलाकृती पाठवल्या: एरर डिटेक्शन मोजण्यासाठी एक विरोधाभास बेंचमार्क आणि मल्टी-लेयर्ड रिव्ह्यू (MLR) सिस्टीम ज्याने प्रत्येक बेसलाइन चाचणी केली. पीअर रिव्ह्यू वाढवण्यासाठी AI वापरण्यात वाढत्या स्वारस्य दरम्यान परिणाम प्राप्त झाले आहेत - वाढत्या सबमिशन व्हॉल्यूममुळे तणावाखाली असलेली प्रक्रिया. AI संशोधनाला स्वतःचा आकार कसा बदलत आहे याबद्दल अधिक माहितीसाठी, आमच्या नवीनतम AI घडामोडी फॉलो करा.
लावलेल्या चुकांचा बेंचमार्क
विरोधाभास बेंचमार्क वास्तविक कागदपत्रांमध्ये त्रुटी ठेवतो आणि पुनरावलोकनकर्ते त्या पकडतात की नाही ते तपासते. संशोधकांनी ACL, AISTATS, CVPR, आणि ICML 2025, तसेच NeurIPS 2024 कडून 257 CC-परवानाकृत कागदपत्रे गोळा केली, त्यानंतर प्रत्येक पेपरचे दावे, पुरावे आणि पद्धतींचा ज्ञान आलेख तयार करण्यासाठी Gemini 2.5 Pro चा वापर केला.
तीव्रता संरचनात्मकपणे परिभाषित केली जाते: पेपरच्या "मुख्य हक्क" पासून नोडचे अंतर त्रुटी किती मध्यवर्ती आहे हे निर्धारित करते. अंतर शून्य एक मुख्य हक्क दाबा; मोठे अंतर समर्थन तपशील दाबा. GPT-4.1 नंतर प्रति अंतरावर एक नोड एका विरोधाभासात पुन्हा लिहितो, एकूण 1,164 डेटा पॉइंट तयार करतो. o3 न्यायाधीश प्रत्येक पुनरावलोकनास दहा वेळा गुण देतात. स्वच्छ कागदपत्रांवर न्यायाधीशाने 99.9% अचूकता गाठली आणि मॅन्युअली पुष्टी केलेल्या कॅचवर त्याने 86.8% संवेदनशीलता दर्शविली — म्हणजे नोंदवलेले डिटेक्शन स्कोअर प्रत्यक्षात पुराणमतवादी असू शकतात.
बहु-स्तरित पुनरावलोकन कसे कार्य करते
एमएलआर ही एक एजंटिक प्रणाली आहे जी एखाद्या कागदावर टीका करण्यापूर्वी त्याला समजते, ऑफ-द-शेल्फ क्लॉड मॉडेल्सवर चालणाऱ्या तीन विशेष एजंट्सकडून एकत्र केले जाते — जीपीयू क्लस्टर नाही आणि फाइन-ट्यूनिंगची आवश्यकता नाही:
- परिशिष्ट एजंट (क्लॉड हायकू ३.५): परिशिष्टातील प्रयोग आणि अंमलबजावणी तपशील सारांशित करतो.
- साहित्य पुनरावलोकन एजंट (क्लॉड सॉनेट 4, पर्यायी): पूर्वीच्या कामाच्या संदर्भात पेपर ठेवण्यासाठी वेब शोध वापरतो.
- पुनरावलोकन एजंट (क्लॉड सॉनेट ४): संगणक शास्त्रज्ञ एस. केशव यांच्या सुप्रसिद्ध "थ्री-पास ॲप्रोच" द्वारे प्रेरित तीन-पास प्रॉम्प्ट शृंखला चालवते — प्रथम उच्च-स्तरीय बाह्यरेखा, नंतर तपशीलवार वाचा फ्लॅगिंग कमकुवतपणा, गृहितके आणि अंतर आणि शेवटी एक कमकुवतपणा, सर्व सामर्थ्य, एक सामर्थ्य, सर्व प्रश्न. शिफारस, स्कोअर आणि कामांची यादी.
पीडीएफ थेट मॉडेल्सवर पाठवली जाते, त्यामुळे आकडे आणि समीकरणे प्रक्रियेत टिकून राहतात. प्रणाली मुख्य मजकूराच्या 10 पृष्ठांपर्यंत वाचते आणि सकाना प्रति पुनरावलोकन अंदाजे $0.47 खर्च करते.
परिणाम: डिझाइन आणि मॉडेल चॉईस दोन्ही महत्त्वाच्या आहेत
MLR ने बेंचमार्कवर चाचणी केलेल्या सर्व चार प्रणालींचे नेतृत्व केले. चार स्वतंत्र पुनरावलोकनांसह, याने 73.43% कोर-दावा (अंतर-शून्य) विरोधाभास आणि एकूण 40.95% पकडले. सर्वोत्तम बेसलाइन, AgentReview नावाची प्रणाली, मूळ दाव्यांवर केवळ 14.81% व्यवस्थापित केली. अगदी एका MLR पुनरावलोकनात 60.79% मूळ-दाव्याच्या त्रुटी आढळल्या.
पृथक्करण अभ्यास मॉडेलच्या निवडीपासून डिझाइनचे योगदान वेगळे करतो. विद्यमान पुनरावलोकन पाइपलाइनमध्ये क्लॉड सॉनेट 4 साठी GPT-4.1 स्वॅपिंग केल्याने कोर-दावा शोध 14.56% वरून 35.40% वर आला, तर MLR च्या मल्टी-एजंट डिझाइनने एकाच पुनरावलोकनासाठी सुमारे 25 टक्के अधिक गुण जोडले. त्रुटी मुख्य दाव्यापासून दूर गेल्याने शोध अचूकता कमी होते, जे लेखक म्हणतात की तीव्रता स्कोअरिंगचे समर्थन करते.
अव्यवस्थित, वास्तविक-जगातील डेटावर चित्र गडद होते. WithdrarXiv-Check वर, 211 प्रत्यक्षात मागे घेतलेल्या arXiv कागदपत्रांचा संच, MLR ने "समान" सामन्यांवर 26.07% आणि अचूक जुळण्यांवर 16.11% गुण मिळवले — आणि प्रणाली हस्तलिखित मजकूरात लावलेल्या छुप्या प्रॉम्प्ट इंजेक्शनसाठी असुरक्षित राहते. वास्तविक मागे घेतलेले पेपर वाचणे, दुसऱ्या शब्दांत, सिंथेटिक विरोधाभास पकडण्यापेक्षा खूप कठीण आहे.
पीअर रिव्ह्यूसाठी याचा अर्थ काय आहे
अभ्यासाचे सर्वात व्यावहारिक टेकअवे हे कमीत कमी मोहक असू शकतात: सिस्टम डिझाइन आणि मॉडेल निवड दोन्ही भौतिकरित्या त्रुटी शोधणे हलवतात, आणि समीक्षक जे निर्णय घेण्यापूर्वी वाचतात त्यांना मानवी पुनरावलोकन मजकूरावर नमुना जुळणाऱ्या त्रुटींपेक्षा खूप गंभीर त्रुटी आढळतात. हा फरक महत्त्वाचा आहे कारण AI-सहाय्यित पुनरावलोकनावरील बहुतेक पूर्वीचे काम मानवी निर्णयांशी सहमत होण्यासाठी ऑप्टिमाइझ केलेले आहे - एक मेट्रिक जे खऱ्या छाननीऐवजी आत्मविश्वास-आवाजदायक अनुरूपतेला बक्षीस देते.
Sakana चे परिणाम सूचित करत नाहीत की AI मानवी रेफरींची जागा घेण्यास तयार आहे - एक प्रणाली जी वास्तविक मागे घेतलेल्या कागदपत्रांवर बहुतेक चुका चुकवते आणि एम्बेडेड प्रॉम्प्ट्सद्वारे हाताळली जाऊ शकते ती एक सहाय्यक स्तर म्हणून उत्तम मानली जाते, प्राधिकरण नाही. बेंचमार्कच्या सिंथेटिक त्रुटी देखील सांख्यिकीय संदिग्धता आणि प्रतिस्पर्धी व्याख्यांपेक्षा अधिक स्वच्छ आहेत जे समवयस्क पुनरावलोकनामध्ये वास्तविक मतभेदांवर वर्चस्व गाजवतात, म्हणून लागवड केलेल्या विरोधाभासांवर कार्यप्रदर्शन हे वचन म्हणून नव्हे तर कमाल मर्यादा म्हणून वाचले पाहिजे.
परंतु अंदाजे $0.47 प्रति पुनरावलोकन, चाचणी केलेल्या कोणत्याही प्रणालीच्या सर्वोच्च त्रुटी-शोधन दरासह, MLR नजीकच्या मुदतीकडे निर्देश करते जेथे AI समीक्षक विरोधाभासांसाठी फर्स्ट-पास स्क्रीन हाताळतात तर मानवी समीक्षक निर्णयावर लक्ष केंद्रित करतात जे मशीन अद्याप करू शकत नाहीत. जर्नल्स आणि कॉन्फरन्स आयोजक जे LLM-सहाय्यित पुनरावलोकनाचा प्रयोग करतात त्यांच्याकडे आता सार्वजनिक बेंचमार्क आणि त्यांच्या स्वत: च्या सिस्टीमच्या विरूद्ध मोजण्यासाठी मजबूत आधाररेखा दोन्ही आहे — आणि, जर 73.43% आणि 14.81% मधील अंतर टिकून राहिल्यास, आर्किटेक्चर वाचणे कच्च्या मॉडेलच्या आकारापेक्षा जास्त महत्त्वाचे आहे हे स्पष्ट संकेत.
---
एआयच्या पुढे राहानवीनतम AI बातम्या, विश्लेषण आणि यश मिळवा — सर्व एकाच ठिकाणी.
अधिक AI बातम्या वाचा →