विकेंद्रित AI लॅब प्राइम इंटेलेक्टने आजचे फ्रंटियर AI मॉडेल स्वायत्त मशीन लर्निंग संशोधन किती चांगल्या प्रकारे पार पाडू शकतात या चाचणीच्या मोठ्या प्रमाणावरील प्रयोगाचे परिणाम प्रकाशित केले आहेत — आणि त्यापैकी सर्वोत्कृष्ट सामुदायिक बेंचमार्कवर मानवी जागतिक विक्रमाशी जुळण्याच्या अगदी जवळ आले आहेत.
नॅनोजीपीटी स्पीडरन फ्रंटियर असे नाव असलेल्या आणि 22 ऑगस्ट रोजी प्रकाशित झालेल्या या प्रकल्पात नॅनोजीपीटी ऑप्टिमायझर स्पीडरनचा प्रयत्न करणाऱ्या 18 फ्रंटियर मॉडेल्समध्ये 153 स्वायत्त धावांचा समावेश आहे - एक स्पर्धा ज्यामध्ये संशोधक एका निश्चित गुणवत्तेच्या लक्ष्यासाठी लहान भाषेच्या मॉडेलला प्रशिक्षित करण्याचा सर्वात कार्यक्षम मार्ग शोधतात. ही कथा त्वरीत हॅकर न्यूजच्या पहिल्या पानावर चढली, जिथे खऱ्या वैज्ञानिक शोधासाठी AI च्या क्षमतेबद्दल परिणाम काय म्हणतात यावर चर्चा करणाऱ्या डझनभर टिप्पण्या आल्या. For more context on this story, see our ongoing breaking AI news.
नॅनोजीपीटी स्पीडरन प्रत्यक्षात काय आहे
बेंचमार्क केलर जॉर्डनने राखलेल्या मॉडेड-नॅनोगप्ट रिपॉझिटरी आणि समुदाय योगदानकर्त्यांच्या दीर्घ सूचीमधून येतो. हे आव्हान फसवेपणाने सांगणे सोपे आहे: 8 NVIDIA H100 GPUs वापरून, FineWeb प्रमाणीकरण सेटवर 3.28 क्रॉस-एंट्रॉपी लॉसपर्यंत पोहोचणारे भाषा मॉडेल प्रशिक्षित करा — कार्यप्रदर्शन पातळी Andrej Karpathy ची मूळ GPT-2 प्रतिकृती 45 मिनिटांनंतर पोहोचली — शक्य तितक्या लवकर.
गेल्या दोन वर्षांत शेकडो सामुदायिक योगदानांद्वारे, मानवी रेकॉर्ड 75 सेकंदांपेक्षा कमी आणि 400 दशलक्ष प्रशिक्षण टोकनच्या खाली आणले गेले आहे, जी मूळ रेसिपीपेक्षा 30 पटीने अधिक सुधारणा आहे. विजयी समाधाने आधुनिक ML अभियांत्रिकीच्या कॅटलॉगप्रमाणे वाचतात: Muon ऑप्टिमायझर, QK-Norm सह रोटरी एम्बेडिंग, ReLU-squared activations, FP8 क्वांटायझेशन ऑन अटेन्शन आणि MLP पास, फ्लॅश अटेंशन 3 स्लाइडिंग-विंडो पॅटर्नसह, आणि इतर डझनभर तंत्रे एकमेकांच्या वर स्टॅक केलेली आहेत.
प्राइम इंटलेक्टच्या चाचणीने बेंचमार्कचा ऑप्टिमायझर ट्रॅक वापरला, जो — रेपॉजिटरीच्या दस्तऐवजीकरणानुसार — प्रभावीपणे अमर्यादित वॉल-क्लॉक बजेटसह, निश्चित आर्किटेक्चर, डेटासेट आणि बॅच आकाराच्या अधीन, लक्ष्य तोटा गाठण्यासाठी आवश्यक असलेल्या प्रशिक्षण चरणांची संख्या कमी करते. हे कच्च्या हार्डवेअर गतीऐवजी अल्गोरिदम शोधाची शुद्ध चाचणी बनवते.
प्रयोग कसा चालला
18 मॉडेल्सपैकी प्रत्येकाला स्वायत्तपणे कार्य दिले गेले: प्रशिक्षण रेसिपीमध्ये बदल सुचवा, प्रयोग चालवा, परिणामांची तपासणी करा आणि पुनरावृत्ती करा — निश्चित सत्यापन स्क्रिप्ट आणि निश्चित यादृच्छिक बियांसह हे सुनिश्चित करा की दावा केलेली सुधारणा भाग्यवान धावण्याऐवजी वास्तविक आहे. एका हॅकर न्यूज टिप्पणीकर्त्याने त्याचा सारांश दिल्याप्रमाणे, मॉडेल्सना लहान मॉडेलचे प्रशिक्षण कसे सुधारावे, वारंवार बदल करण्याचा प्रयत्न करणे, त्यांची चाचणी घेणे आणि पुढे काय प्रयत्न करायचे हे ठरवण्यासाठी परिणामांचा वापर करून संशोधन करण्यास सांगितले गेले.
मॉडेल्सने विविध एजंट हार्नेसद्वारे काम केले — क्लॉड-कोड, ओपनएआयचे कोडेक्स, किमी-कोड, ग्रोक-क्ली, क्वेन-कोड, आणि प्राइम इंटेलेक्टचा स्वतःचा प्राइम-एजंट — आणि टीमने प्रत्येक रनचा टोकन वापर, प्रयोग संख्या, टूल कॉल्स आणि एजंटच्या वेळेचा मागोवा घेतला. एकूण, प्रयोगाने प्रति शीर्ष मॉडेल शेकडो लाखो टोकन आणि संपूर्ण ग्रीडमध्ये अब्जावधींचा वापर केला.
लीडरबोर्ड: दंतकथा 5 पॅकमध्ये आघाडीवर आहे
हेडलाइन परिणाम: फॅबल 5 म्हणून ओळखले जाणारे मॉडेल, क्लॉड-कोड हार्नेसद्वारे चालत असून, लीडरबोर्डच्या मेट्रिकवर 2,726 च्या उत्कृष्ट प्रमाणित निकालासह, बेसलाइन रेसिपी आणि मानवी रेकॉर्डमधील अंतर 81.7 टक्के पूर्ण केले. तेथे पोहोचण्यासाठी 8.7 दिवसांचा एकत्रित एजंट वेळ, अंदाजे 800 दशलक्ष टोकन, 811 प्रयोग आणि सुमारे 3,000 टूल कॉल्स लागले.
चेसिंग पॅकचे नेतृत्व Opus 5 ने केले, ज्याने 53.6 टक्के अंतर पूर्ण केले, त्यानंतर Kimi K3 ने 52.2 टक्के प्राईम इंटलेक्टच्या प्राइम-एजंट हार्नेस (आणि 45.8 टक्के किमी-कोडद्वारे) चालविले. Opus 4.8 ने 39.4 टक्के व्यवस्थापित केले, अनेक GPT-5.6 रूपे अंदाजे 11 ते 36 टक्के, सॉनेट 5 बंद झाले 26.8 टक्के, आणि Grok 4.5 आणि Qwen3.8 Max प्रत्येकी 24.6 टक्क्यांपर्यंत पोहोचले.
आणखी खाली, DeepSeek V4 Pro ने 12.3 टक्के अंतर बंद केले, GPT-5.5 ने 8.1 टक्क्यांवर पोहोचले, आणि जुन्या किमी K2.7 ने 7.2 टक्के अंतर पूर्ण केले. विशेष म्हणजे, नुकतेच रिलीझ झालेले एक मॉडेल — GLM 5.3 — प्रकाशनाच्या वेळी अद्याप कोणतेही प्रमाणीकृत रेकॉर्ड नसताना चालू होते, हे स्मरणपत्र आहे की बेंचमार्क अशा मॉडेल्सना शिक्षा करतो जे त्यांच्या स्वतःच्या सुधारणांचे विश्वसनीयरित्या प्रमाणीकरण करू शकत नाहीत.
हे महत्त्वाचे का आहे
बेंचमार्कला ही बाब आवडते कारण ते कोडिंग लीडरबोर्ड करू शकत नाही असे काहीतरी मोजतात: वास्तविक संशोधन लूप चालवण्याची क्षमता — गृहीतक, प्रयोग, विश्लेषण, पुनरावृत्ती — मिनिटांपेक्षा दिवसांमध्ये. ही क्षमता स्वायत्त एआय संशोधनाच्या उदयोन्मुख क्षेत्राचा पाया आहे, ज्यामध्ये एजंटना कोड लिहिण्याचे काम नाही तर कोणीही दाखविलेल्या गोष्टी शोधण्याचे काम केले जाते.
परिणामांचा प्रसार स्वतःच माहितीपूर्ण आहे. प्रकल्पाच्या लेखनानुसार प्रयोगातील जवळजवळ प्रत्येक मॉडेलला समान मुख्य विजयी कल्पना सापडल्या — प्रयोगाने जे सर्वोत्कृष्ट धावा सोडल्या ते वेगळे केले गेले: मजबूत एजंटांनी गोंगाटाच्या परिणामांमध्ये कमकुवत सिग्नल ते प्रमाणित करण्यासाठी पुरेसा जतन केला आणि त्यांचा स्वतःचा प्रायोगिक डेटा अधिक चांगल्या प्रकारे समजून घेतला.
समाजाकडून चेतावणी
हॅकर न्यूज टिप्पणीकर्त्यांनी योग्य पद्धतशीर मुद्दे मांडले. प्रयत्न सेटिंग्ज आणि हार्नेस वेगवेगळ्या मॉडेल्समध्ये भिन्न आहेत — Fable 5 उच्च तर्कसंगत सेटिंगवर चालले तर Opus 5 कमाल वर चालले — आणि 18 मॉडेलमध्ये 153 धावांचे अंकगणित सूचित करते की काही मॉडेल्सना इतरांपेक्षा जास्त प्रयत्न मिळाले. मॉडेलचे रँकिंग त्याच्या कच्च्या संशोधन क्षमतेचे प्रतिबिंबित करते की त्याच्या हार्नेसची गुणवत्ता हा एक खुला प्रश्न आहे.
तरीही प्रवासाची दिशा स्पष्ट आहे. जेव्हा सर्वात वेगवान मानवी हातांना सध्याच्या रेकॉर्डपर्यंत पोहोचण्यासाठी अनेक वर्षे सामूहिक प्रयत्न करावे लागले, तेव्हा सर्वोत्कृष्ट स्वायत्त एजंट आता गणना वेळेच्या एका आठवड्यापेक्षा थोड्या वेळात ते अंतर पूर्ण करत आहेत. पुढील प्रश्न - कोणतेही मॉडेल उर्वरित 18.3 टक्के बंद करू शकते का - अपेक्षेपेक्षा लवकर उत्तर दिले जाऊ शकते.
AI च्या सीमारेषेला आकार देणारे बेंचमार्क आणि संशोधनाबद्दल अधिक माहितीसाठी, AI Buzz Wire च्या सतत कव्हरेजचे अनुसरण करा.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →