एक नवीन बेंचमार्क AI उद्योग वैज्ञानिक क्षमतेचे कसे मोजमाप करतो हे आव्हान देत आहे आणि त्याचे पहिले परिणाम फ्रंटियर लॅबसाठी नम्र आहेत. टर्मिनल-बेंच-सायन्स 0.1, स्टॅनफोर्ड युनिव्हर्सिटीच्या संशोधकांनी आणि लोकप्रिय टर्मिनल-बेंच कोडिंग बेंचमार्कच्या मागे असलेल्या टीमने या आठवड्यात लॉन्च केले, कार्यरत शास्त्रज्ञांनी योगदान दिलेल्या वास्तविक वैज्ञानिक संशोधन कार्यप्रवाहांवर AI एजंट्सचे मूल्यमापन करते — आणि चाचणी केलेले सर्वात मजबूत मॉडेल, क्लॉड ओपस 5 द्वारे क्लॉड ओपस 5 पूर्ण झाले, फक्त क्लॉड %3 द्वारे पूर्ण झाले.

बेंचमार्कचे घोषणा पृष्ठ त्याच्या मार्गदर्शक तत्त्वाचे स्पष्टपणे वर्णन करते: वैज्ञानिकांनी, मॉडेल डेव्हलपर किंवा डेटा विक्रेत्यांनी नाही, AI मध्ये वैज्ञानिक क्षमतेसाठी बार सेट केला पाहिजे. हा प्रकल्प जगभरातील संशोधन संस्थांमधील डोमेन तज्ञांच्या सहकार्याने तयार करण्यात आला होता आणि त्याच्या पहिल्या प्रकाशनात जीवन विज्ञान, भौतिकशास्त्र, पृथ्वी विज्ञान, गणित आणि अभियांत्रिकी या क्षेत्रांतील 70 कार्ये समाविष्ट आहेत.

ते पाठ्यपुस्तकांच्या बेंचमार्कपेक्षा कसे वेगळे आहे

बहुतेक वैज्ञानिक AI मूल्यमापन ज्ञान चाचणी करतात: बहु-निवडीचे प्रश्न, पाठ्यपुस्तक समस्या, प्रमाणित व्यायाम. टर्मिनल-बेंच-सायन्स त्याऐवजी एजंट तांत्रिकदृष्ट्या मागणी करणारे, वेळ घेणारे वर्कफ्लो कार्यान्वित करू शकतात की नाही हे मोजते जे वास्तविक संशोधकांचे दिवस भरतात - ज्या प्रकारचे काम कोणत्याही परीक्षेत दिसून येत नाही. कार्ये वास्तववादी वातावरणात चालतात आणि प्रतवारी ठोस कलाकृतींवर आधारित असते: विश्लेषणे, सिम्युलेशन, पुरावे, कोड आणि डेटा उत्पादने, न्यायाधीश मॉडेल किंवा एकाधिक-निवड स्कोअरिंगऐवजी पुनरुत्पादित कार्य-विशिष्ट चाचण्यांद्वारे तपासले जातात.

ते डिझाइन एआय सहाय्यकांनी शेवटी विज्ञानासाठी काय केले पाहिजे याचा सिद्धांत प्रतिबिंबित करते. वैज्ञानिक निर्णयाची जागा घेण्याऐवजी, बेंचमार्कच्या लेखकांचा असा युक्तिवाद आहे की, एजंटांनी अंमलबजावणीचा स्तर ताब्यात घेतला पाहिजे — प्रयोग-इन-सिलिको चालवणे, डेटावर प्रक्रिया करणे, पुरावे तपासणे — वैज्ञानिकांना संशोधनाच्या त्या भागांसाठी मोकळे करणे जिथे मानवी निर्णय सर्वात महत्त्वाचे आहेत: प्रश्न परिभाषित करणे, गृहीतके तयार करणे आणि परिणाम शोधणे, परिणाम शोधणे.

प्रकल्प देखील एक हलणारे लक्ष्य म्हणून स्पष्टपणे तयार केले आहे. जेथे अनेक बेंचमार्क एकदा रिलीझ केले जातात आणि सोडून दिले जातात — घोषणा याला "प्रकाशित करण्यासाठी पेपर्स" समस्या म्हणतात — टर्मिनल-बेंच-सायन्स एक सतत बेंचमार्क म्हणून डिझाइन केले आहे जे सीमांच्या बाजूने विकसित होते, मॉडेलच्या प्रगतीच्या पुढे मूल्यमापन ठेवण्यासाठी आणि दूषित स्कोअर चलनवाढ रोखण्यासाठी नियमित प्रकाशनांसह.

पहिला लीडरबोर्ड: विश्वसनीय पासून एक लांब मार्ग

v0.1 लीडरबोर्ड, ज्याने या आठवड्यात हॅकर न्यूजवर पोहोचल्यावर लक्षणीय लक्ष वेधले, ते शीर्षस्थानी एक तीव्र ड्रॉप-ऑफ दर्शवते:

  • क्लॉड ओपस 5 (क्लॉड कोड): 30.0%
  • GPT-5.6 सोल (कोडेक्स): 22.4%
  • क्लॉड फेबल 5 (क्लॉड कोड): 21.4%
  • क्लॉड ओपस 4.8 (क्लॉड कोड): 10.5%
  • GPT-5.6 टेरा (कोडेक्स): 8.6%
  • GLM 5.3 (क्लॉड कोड): 8.1%
  • किमी K3 (क्लॉड कोड): 7.1%
  • Grok 4.6 (Grok बिल्ड): 7.1%
  • GPT-5.6 लुना (कोडेक्स): 3.3%

परिणाम सूचित करतात की वैज्ञानिक कार्यप्रवाह एजंट्ससाठी सॉफ्टवेअर अभियांत्रिकीपेक्षा जास्त कठीण राहतात, जेथे मूळ टर्मिनल-बेंच आणि प्रतिस्पर्धी कोडिंग बेंचमार्कने स्कोअर वेगाने चढत असल्याचे पाहिले आहे. सर्वोत्कृष्ट उपलब्ध प्रणालीसाठी 30% रिझोल्यूशन रेट म्हणजे दहापैकी सात वास्तविक संशोधन कार्यांवर, अगदी मजबूत हार्नेससह जोडलेले शीर्ष-स्तरीय एजंट देखील सत्यापितपणे योग्य कार्य करण्यास अयशस्वी ठरतात.

मॉडेल कुटुंबांमधील प्रसार देखील बोधप्रद आहे. क्लॉड ओपस 5 आणि क्लॉड ओपस 4.8 मधील अंतर — जवळपास वीस पॉइंट — आणि GPT-5.6 व्हेरियंट सोल, टेरा आणि लूना मधील अंतर हे दर्शवते की परिणाम गुणवत्ता मॉडेल आणि एजंट हार्नेसच्या परस्परसंवादावर किती अवलंबून आहे, केवळ कच्च्या मॉडेलच्या बुद्धिमत्तेवर नाही. प्रत्येक उच्च-स्कोअरिंग एंट्री एजंटिक कोडिंग हार्नेस (क्लॉड कोड, कोडेक्स, ग्रोक बिल्ड) वापरते, ज्यामुळे मचान हे अंतर्निहित वजनाइतकेच निर्णायक आहे या उदयोन्मुख सहमतीला बळकटी देते.

शास्त्रज्ञांनी स्वतःचा बेंचमार्क का तयार केला

बेंचमार्कच्या फ्रेमिंगमध्ये सूक्ष्म संस्थात्मक युक्तिवाद आहे. "विज्ञानातील भागीदारी खूप जास्त आहे," घोषणा सांगते, "आणि त्याचे बेंचमार्क बाहेरील हितसंबंधांऐवजी वैज्ञानिक समुदायाच्या प्राधान्यांचे प्रतिबिंबित केले पाहिजेत." प्रकल्प कार्यरत संशोधकांना त्यांना आवश्यक असलेली कार्ये स्वयंचलितपणे एन्कोड करण्यासाठी थेट यंत्रणा देतो — आणि "वैज्ञानिक शोधांना गती देणारा" विक्रेत्यांचे दावे एका पडताळणीयोग्य मानकांविरुद्ध ठेवण्यासाठी.

हे महत्त्वाचे आहे कारण विपणन आणि वास्तविकता यांच्यातील अंतराचे वास्तविक परिणाम आहेत. जर फ्रंटियर लॅबचा दावा असेल की त्यांचे एजंट स्वतंत्र असताना संशोधनाला गती देऊ शकतात, तज्ञ-डिझाइन केलेले मूल्यमापन सिंगल-डिजिट-ते-30% रिझोल्यूशन दर, निधीचे निर्णय, नियुक्ती योजना आणि त्या दाव्यांच्या आधारे तयार केलेली लॅब धोरणे दाखवतात. सतत, समुदायाच्या मालकीचे बेंचमार्क एक सुधारात्मक आहेत: ते अस्पष्ट दाव्यांना पुनरुत्पादित संख्यांमध्ये रूपांतरित करतात.

संशोधन संस्थांसाठी एक सिग्नल

विद्यापीठे, राष्ट्रीय प्रयोगशाळा आणि R&D संघांसाठी एजंट्स कधी तैनात करायचे हे मोजून, बेंचमार्क असे काहीतरी ऑफर करतो जे विक्रेता डेमो करू शकत नाहीत: विश्वासार्हता रेखा प्रत्यक्षात कुठे बसते याचे समुदाय-नियंत्रित मापन. किशोर किंवा वीस वर्षांमध्ये रिझोल्यूशन रेट म्हणजे या प्रणालींना आज सहाय्यक म्हणून सर्वोत्तम मानले जाते ज्यांना पुनरावलोकन आवश्यक आहे, प्रायोगिक पाइपलाइनचे स्वायत्त निष्पादक म्हणून नाही. कार्य श्रेणी — विस्तृत जीवन, भौतिक, पृथ्वी, गणित आणि अभियांत्रिकी विज्ञान — डोमेन विशेषज्ञांना सामान्य बेंचमार्क नियमितपणे दुर्लक्षित केलेल्या फील्डमधील कार्यप्रवाहांचे योगदान देण्यासाठी टेम्पलेट देतात.

वेळ महत्त्वाची का आहे हे व्यापक उद्योग संदर्भ बळकट करते. साहित्य शोध, प्रथिने विज्ञान आणि गणितामध्ये प्रयोगशाळा योगदान देत असलेल्या फ्रंटियर AI साठी विज्ञान हे सर्वात मोठ्या प्रमाणावर प्रोत्साहन दिले जाणारे एक प्रकरण बनले आहे. त्या दाव्यांचे लेखापरीक्षण करणे कठीण आहे: वैज्ञानिक आउटपुट प्रमाणित करण्यासाठी मंद आहे, आणि उत्साह प्रतिकृतीपेक्षा वेगाने हलतो. वास्तविक वर्कफ्लोवर पडताळणी करण्यायोग्य कलाकृतींना ग्रेड देणारा एक बेंचमार्क संशोधन संस्थांना प्रात्यक्षिक थिएटरमधून प्रात्यक्षिक क्षमता विभक्त करण्याचा मार्ग देतो — आणि ट्रॅक करणे, रिलीजद्वारे सोडणे, विज्ञानातील एजंटिक प्रगती सॉफ्टवेअर अभियांत्रिकीमध्ये तितक्याच लवकर होत आहे की नाही, जिथे टर्मिनल-बेंचने पहिले नाव बनवले.

AI उद्योगासाठी, v0.1 चा संदेश दुहेरी आहे. सीमा स्पष्टपणे पुढे जात आहे — जुन्या Opus 4.8 च्या 10.5% पेक्षा Opus 5 चे 30% टॉवर्स — परंतु वास्तविक प्रयोगशाळांना आवश्यक असलेल्या विश्वासार्हतेपासून कमाल मर्यादा दूर आहे. बेंचमार्कचे डिझाइनर म्हणतात की नियमित प्रकाशन हे अंतर किती वेगाने बंद होते याचा मागोवा घेतील. एजंटिक संशोधन साधनांमध्ये उभरते AI ट्रेंड्स पाहणाऱ्या शास्त्रज्ञांना आता त्यांनी स्वतः तयार केलेले मापदंड आहे.

---

एआयच्या पुढे राहा

नवीनतम AI बातम्या, विश्लेषण आणि यश मिळवा — सर्व एकाच ठिकाणी.

अधिक AI बातम्या वाचा →