ऑर्निथ टीम ने ऑर्निथ-1.5 जारी किया है, जो एक असामान्य विचार के आसपास निर्मित ओपन-वेट भाषा मॉडल का एक परिवार है: मॉडल अपने स्वयं के प्रशिक्षण कार्यों को उत्पन्न करता है, अपने स्वयं के मचान डिजाइन करता है, और लगातार चलने वाले लूप में अपने स्वयं के समाधान प्रयासों से सीखता है। टीम के स्वयं के मूल्यांकन के अनुसार, टर्मिनल-बेंच 2.1 (टर्मिनस-2) पर फ्लैगशिप ऑर्निथ-1.5-397बी का स्कोर 86.1 है, जो इसे एंथ्रोपिक के क्लाउड ओपस 4.8 के बराबर 85.0 पर रखता है और तुलनीय आकार के हर दूसरे ओपन-सोर्स मॉडल से आगे है।

एमआईटी लाइसेंस के तहत ऑर्निथ ब्लॉग और हगिंग फेस पर इस सप्ताह प्रकाशित रिलीज, ओपन-सोर्स एआई दौड़ में नवीनतम साल्वो है जिसने नियमित रूप से ऐसे परिणाम उत्पन्न किए हैं जिन्हें फ्रंटियर लैब के बजट के बिना असंभव माना जाता था। [नवीनतम एआई मॉडल समाचार] (https://aibuzzwire.news) पर नज़र रखने वाले डेवलपर्स और उद्यमों के लिए, महत्व दो गुना है: एक अग्रणी बंद मॉडल के साथ बेंचमार्क समानता, और एक प्रशिक्षण नुस्खा जो इंगित करता है कि खुले मॉडल का विकास आगे कहाँ जा रहा है।

तीन आकार, एक विधि

ऑर्निथ-1.5 तीन विन्यासों में आता है: एक 397बी-पैरामीटर मिश्रण-विशेषज्ञों का फ्लैगशिप, एक 35बी एमओई जो प्रति टोकन केवल 3बी पैरामीटर को सक्रिय करता है, और एक कॉम्पैक्ट 9बी डेंस मॉडल जिसमें एक परिमाणित "मोबाइल" संस्करण होता है जिसे सीधे आईफोन और एंड्रॉइड डिवाइस पर चलाने के लिए डिज़ाइन किया गया है। ये तीनों GGUF, MLX और NVFP4 बिल्ड के साथ हगिंग फेस पर उपलब्ध हैं, और मॉडल कार्ड से संकेत मिलता है कि परिवार Qwen3.5 MoE आर्किटेक्चर पर बनाया गया है।

यहां वंशावली मायने रखती है. इस साल की शुरुआत में रिलीज़ हुई ऑर्निथ-1.0 ने एजेंटिक कोडिंग के लिए "सेल्फ-स्कैफोल्डिंग" दृष्टिकोण को लोकप्रिय बनाया और एक शांत हिट बन गई - इसके 9बी जीजीयूएफ बिल्ड ने हगिंग फेस पर पांच मिलियन से अधिक डाउनलोड दर्ज किए हैं। ऑर्निथ-1.5 उस ढांचे को मचान और रोलआउट को अनुकूलित करने से लेकर पूर्ण आत्म-सुधार पाइपलाइन तक विस्तारित करता है।

आत्म-सुधार लूप, समझाया गया

पारंपरिक प्रशिक्षण के बाद की पाइपलाइन में, सुदृढीकरण सीखना मानव-क्यूरेटेड कार्यों के एक निश्चित सेट के विरुद्ध चलता है। इसके बजाय ऑर्निथ-1.5 में मॉडल स्वयं नए कार्यों का प्रस्ताव करता है, एक कार्य-विशिष्ट मचान उत्पन्न करता है - समस्या पर हमला करने के लिए उपयोग किए जाने वाले निर्देश, उपकरण और अपघटन रणनीति - और फिर समाधान रोलआउट का उत्पादन करता है जो कि अभी बनाए गए मचान द्वारा स्कोर किया जाता है। जीआरपीओ का उपयोग करके पुरस्कार को तीनों चरणों के माध्यम से वापस प्रसारित किया जाता है, इसलिए सिस्टम एक साथ बेहतर कार्य, बेहतर मचान और बेहतर समाधान लिखना सीखता है।

कार्य-उत्पन्न पुरस्कार डिज़ाइन का हृदय है। प्रत्येक प्रस्तावित कार्य को तीन गुणात्मक संकेतों पर स्कोर किया जाता है: वैधता (क्या मचान सही ढंग से निष्पादित और मूल्यांकन करता है?), सीमांत कठिनाई (क्या मॉडल की अनुभवजन्य सफलता दर लगभग 20 प्रतिशत के लक्ष्य के करीब है, कार्यों को चुनौतीपूर्ण लेकिन सीखने योग्य बनाए रखती है?), और नवीनता (क्या यह पहले से उत्पन्न कार्यों के बफर में हर चीज से पर्याप्त रूप से अलग है?)। चूँकि कठिनाई को मॉडल की अपनी वर्तमान सफलता दर के विरुद्ध मापा जाता है, मॉडल में सुधार होने पर पाठ्यक्रम स्वचालित रूप से बढ़ जाता है।

टीम मूल्यांकन के दौरान स्पष्ट एंटी-हैकिंग उपायों की भी रिपोर्ट करती है: गिट इतिहास को रिपॉजिटरी छवियों से हटा दिया जाता है ताकि मॉडल पूर्व समाधानों को पुनर्प्राप्त न कर सकें, और मॉडल को बाहरी उत्तर प्राप्त करने से रोकने के लिए नेटवर्क पहुंच अक्षम कर दी गई है। सभी परिणाम पांच स्वतंत्र रनों पर औसत हैं।

संख्याएँ

एजेंटिक कोडिंग पर, फ्लैगशिप के स्व-रिपोर्ट किए गए परिणाम ओपन-सोर्स फ़ील्ड के शीर्ष पर क्लस्टर होते हैं। टर्मिनल-बेंच 2.1 पर टर्मिनस-2 हार्नेस के माध्यम से चलाएं, ऑर्निथ-1.5-397बी के 86.1 किनारे क्लाउड ओपस 4.8 (85.0), डीपसीक-वी4-फ्लैश-0731 (82.7), और जीएलएम-5.2 (81) से बाहर हैं। क्लाउड कोड हार्नेस के माध्यम से चलने वाले समान बेंचमार्क पर, ऑर्निथ-1.5 ओपस 4.8 के 78.9 के मुकाबले 85.2 पोस्ट करता है। SWE-बेंच सत्यापित पर, दोनों प्रभावी रूप से 86.0 और 85.8 पर बराबरी पर हैं, किमी K3 86.2 पर थोड़ा आगे है।

कठिन एजेंटिक सुइट्स पर अंतराल चौड़ा हो जाता है। डीपएसडब्ल्यूई पर, ऑर्निथ-1.5-397बी का स्कोर 56.0 है - जो जीएलएम-5.2 के 46.2 से आगे है, हालांकि ओपस 4.8 (59.0) और किमी के3 (67.5) से पीछे है। सबसे उल्लेखनीय छलांग पीढ़ीगत है: ऑर्निथ-1.0 ने डीपएसडब्ल्यूई पर केवल 8.0 स्कोर किया, जिसका अर्थ है कि नया पुनरावृत्ति समान बेंचमार्क परिवार पर सात गुना सुधार प्रदान करता है।

छोटे मॉडल अपनी कहानी खुद बताते हैं। ऑर्निथ-1.5-35बी-ए3बी, प्रति टोकन केवल 3बी पैरामीटर सक्रिय करते हुए, टर्मिनल-बेंच 2.1 (क्लाउड कोड) पर 68.5 स्कोर करता है, जबकि गूगल के जेम्मा 4-31बी के लिए 43.4 और मेटा के म्यूज़ ग्लिमर-30बी के लिए 51.7, और एसडब्ल्यूई-बेंच सत्यापित पर 79.0 पोस्ट करता है। 9बी मॉडल टर्मिनल-बेंच 2.1 पर 47.0, एसडब्ल्यूई-बेंच सत्यापित पर 70.6 और जीपीक्यूए डायमंड पर 86.4 तक पहुंचता है - संख्याएं जो फोन-क्लास मॉडल को डेस्कटॉप-क्लास प्रतिद्वंद्वियों से काफी दूरी पर रखती हैं।

चेतावनी और संदर्भ

ये डेवलपर द्वारा संचालित बेंचमार्क हैं, स्वतंत्र रूप से ऑडिट किए गए परिणाम नहीं हैं, और तुलनात्मक मॉडल का मूल्यांकन ऑर्निथ टीम द्वारा अपनी स्वयं की हार्नेस सेटिंग्स के तहत किया गया था। प्रतिद्वंद्वी प्रयोगशालाएँ भी अलग-अलग ट्रेड-ऑफ़ के लिए तैयार हैं; डीपएसडब्ल्यूई पर किमी के3 की बढ़त से पता चलता है कि एजेंटिक सॉफ्टवेयर कार्य की सीमा अभी भी विवादित है। लेकिन रिलीज़ की पूर्ण-तालिका पारदर्शिता - पांच-रन औसत, प्रकाशित हार्नेस कॉन्फ़िगरेशन, प्रकट सुरक्षा उपाय - स्वतंत्र पुनरुत्पादन को असामान्य रूप से सरल बनाती है।

सामुदायिक प्रतिक्रिया पर्याप्त रही है। रिलीज़ की घोषणा ने कुछ ही घंटों में हैकर न्यूज़ पर सौ से अधिक अंक प्राप्त कर लिए, जिसमें चर्चा स्व-सुधार पद्धति की तुलना में बेंचमार्क दावों पर कम केंद्रित थी, जिसे कई टिप्पणीकारों ने पुनरावर्ती-शैली कार्य पीढ़ी के अधिक विश्वसनीय खुले कार्यान्वयन में से एक के रूप में वर्णित किया।

ओपन-सोर्स इकोसिस्टम के लिए, ऑर्निथ-1.5 ऐसे समय में आया है जब चीन की प्रयोगशालाओं और पश्चिमी स्वतंत्र टीमों के ओपन मॉडल कोडिंग और एजेंटिक कार्यों पर बंद सीमाओं के साथ अंतर को कम कर रहे हैं। एक एमआईटी-लाइसेंस प्राप्त परिवार जो टर्मिनल-बेंच पर एक अग्रणी बंद मॉडल से मेल खाता है - और एक फोन-रेडी 9बी वेरिएंट को शिप करता है - उस अंतर को और कम करता है, और इसे एक प्रशिक्षण पद्धति के साथ करता है जिसे कोई भी निरीक्षण, पुनरुत्पादन और विस्तार कर सकता है।

---

एआई से आगे रहें

नवीनतम एआई समाचार, विश्लेषण और सफलताएँ प्राप्त करें - सभी एक ही स्थान पर।

अधिक AI समाचार पढ़ें →