Ornith टीमने Ornith-1.5, एका असामान्य कल्पनेवर आधारित ओपन-वेट लँग्वेज मॉडेल्सचे एक कुटुंब रिलीझ केले आहे: मॉडेल स्वतःचे प्रशिक्षण कार्य तयार करते, स्वतःचे स्कॅफोल्ड तयार करते आणि सतत चालू असलेल्या लूपमध्ये स्वतःच्या निराकरणाच्या प्रयत्नांमधून शिकते. संघाच्या स्वतःच्या मूल्यमापनानुसार, फ्लॅगशिप Ornith-1.5-397B ने टर्मिनल-बेंच 2.1 (टर्मिनस-2) वर 86.1 स्कोअर केला आहे, तो अँथ्रोपिकच्या क्लॉड ओपस 4.8 च्या बरोबरीने 85.0 वर आणला आहे आणि तुलनात्मक आकाराच्या इतर प्रत्येक ओपन-सोर्स मॉडेलच्या पुढे आहे.
या आठवड्यात ऑर्निथ ब्लॉगवर आणि एमआयटी परवान्याअंतर्गत हगिंग फेसवर प्रकाशित झालेले प्रकाशन हे ओपन-सोर्स एआय शर्यतीतील नवीनतम सॅल्व्हो आहे ज्याने एकेकाळी फ्रंटियर लॅबच्या बजेटशिवाय अशक्य वाटणारे परिणाम नियमितपणे दिले आहेत. डेव्हलपर आणि एंटरप्रायझेस जे नवीनतम AI मॉडेल न्यूज चा मागोवा घेतात, त्याचे महत्त्व दुप्पट आहे: आघाडीच्या बंद मॉडेलसह बेंचमार्क पॅरिटी आणि एक प्रशिक्षण रेसिपी जे ओपन मॉडेल डेव्हलपमेंट पुढे जात आहे ते दर्शवते.
तीन आकार, एक रेसिपी
Ornith-1.5 तीन कॉन्फिगरेशनमध्ये पाठवते: 397B-पॅरामीटर मिश्रण-तज्ञांचे फ्लॅगशिप, एक 35B MoE जे प्रति टोकन फक्त 3B पॅरामीटर्स सक्रिय करते, आणि आयफोन आणि Android डिव्हाइसेसवर थेट चालण्यासाठी डिझाइन केलेले क्वांटाइज्ड "मोबाइल" व्हेरिएंटसह कॉम्पॅक्ट 9B दाट मॉडेल. तिन्ही GGUF, MLX आणि NVFP4 बिल्ड्सच्या बरोबरीने हगिंग फेसवर उपलब्ध आहेत आणि मॉडेल कार्ड्स दर्शवतात की कुटुंब Qwen3.5 MoE आर्किटेक्चरवर बांधले गेले आहे.
येथे वंश महत्त्वाचा आहे. Ornith-1.0, या वर्षाच्या सुरुवातीला रिलीझ झाला, एजंटिक कोडिंगसाठी "सेल्फ-स्कॅफोल्डिंग" दृष्टीकोन लोकप्रिय झाला आणि तो एक शांत हिट ठरला — त्याच्या 9B GGUF बिल्डने हगिंग फेसवर पाच दशलक्षाहून अधिक डाउनलोड लॉग केले आहेत. Ornith-1.5 त्या फ्रेमवर्कला स्कॅफोल्ड्स आणि रोलआउट्स ऑप्टिमाइझ करण्यापासून पूर्ण स्वयं-सुधारणा पाइपलाइनमध्ये विस्तारित करते.
स्वयं-सुधारणा वळण, स्पष्ट केले
पारंपारिक पोस्ट-ट्रेनिंग पाइपलाइनमध्ये, मजबुतीकरण शिक्षण मानवी-क्युरेट केलेल्या कार्यांच्या निश्चित संचाविरूद्ध चालते. त्याऐवजी Ornith-1.5 मध्ये मॉडेल स्वतः नवीन कार्ये प्रस्तावित करते, कार्य-विशिष्ट स्कॅफोल्ड तयार करते — समस्यांवर हल्ला करण्यासाठी वापरल्या जाणाऱ्या सूचना, साधने आणि विघटन धोरण — आणि नंतर सोल्यूशन रोलआउट्स तयार करतात जे ते नुकतेच तयार केलेल्या स्कॅफोल्डद्वारे प्राप्त केले जातात. GRPO वापरून तिन्ही टप्प्यांतून रिवॉर्डचा प्रसार केला जातो, त्यामुळे प्रणाली एकाच वेळी चांगली कार्ये, चांगले मचान आणि चांगले उपाय लिहायला शिकते.
टास्क-जनरेशन रिवॉर्ड हे डिझाइनचे हृदय आहे. प्रत्येक प्रस्तावित कार्य तीन गुणाकार संकेतांवर स्कोअर केले जाते: वैधता (मचान योग्यरित्या कार्यान्वित करते आणि मूल्यमापन करते का?), फ्रंटियर अडचण (मॉडेलचा अनुभवजन्य यशाचा दर अंदाजे 20 टक्के लक्ष्याजवळ आहे, कार्ये आव्हानात्मक परंतु शिकण्यायोग्य ठेवणे?), आणि नवीनता (हे पूर्वीच्या प्रत्येक कार्यापेक्षा पुरेसे वेगळे आहे का?). अडचण मॉडेलच्या स्वतःच्या सध्याच्या यशाच्या दरामध्ये मोजली जात असल्यामुळे, मॉडेल सुधारत असताना अभ्यासक्रम आपोआप वाढतो.
टीम मूल्यांकनादरम्यान स्पष्ट अँटी-हॅकिंग उपायांचा देखील अहवाल देते: रेपॉजिटरी प्रतिमांमधून गिट इतिहास काढून टाकला जातो त्यामुळे मॉडेल्स पूर्वीचे उपाय पुनर्प्राप्त करू शकत नाहीत आणि मॉडेल्सना बाह्य उत्तरे आणण्यापासून रोखण्यासाठी नेटवर्क प्रवेश अक्षम केला जातो. सर्व निकालांची सरासरी पाच स्वतंत्र धावांवर आहे.
संख्या
एजंटिक कोडिंगवर, ओपन-सोर्स फील्डच्या शीर्षस्थानी फ्लॅगशिपचे स्वयं-रिपोर्ट केलेले परिणाम क्लस्टर. टर्मिनल-बेंच 2.1 वर टर्मिनस-2 हार्नेसमधून चालते, Ornith-1.5-397B चे 86.1 किनारे क्लॉड ओपस 4.8 (85.0), DeepSeek-V4-Flash-0731 (82.7), आणि GLM-5.2 (81) बाहेर काढतात. क्लॉड कोड हार्नेसद्वारे चालवल्या जाणाऱ्या त्याच बेंचमार्कवर, ओपस 4.8 च्या 78.9 विरुद्ध ऑर्निथ-1.5 85.2 पोस्ट करते. SWE-bench Verified वर, दोघे प्रभावीपणे 86.0 आणि 85.8 वर बांधले गेले आहेत, Kimi K3 86.2 वर थोडे पुढे आहे.
कठिण एजंटिक सूट्सवर अंतर रुंद होते. DeepSWE वर, Ornith-1.5-397B स्कोअर 56.0 - GLM-5.2 च्या 46.2 च्या पुढे, जरी Opus 4.8 (59.0) आणि Kimi K3 (67.5) च्या मागे. सर्वात उल्लेखनीय उडी जनरेशनल आहे: Ornith-1.0 ने DeepSWE वर फक्त 8.0 स्कोअर केला, म्हणजे नवीन पुनरावृत्ती समान बेंचमार्क कुटुंबात सातपट सुधारणा देते.
लहान मॉडेल त्यांची स्वतःची कथा सांगतात. Ornith-1.5-35B-A3B, प्रति टोकन फक्त 3B पॅरामीटर्स सक्रिय करून, टर्मिनल-बेंच 2.1 (क्लॉड कोड) वर 68.5 विरुद्ध Google च्या Gemma 4-31B साठी 43.4 आणि Meta's Muse Glimmer-30 वर 51.7 आणि Verb-30 वर Vere-Bench. 9B मॉडेल टर्मिनल-बेंच 2.1 वर 47.0, SWE-बेंच व्हेरिफाइड वर 70.6 आणि GPQA डायमंडवर 86.4 पर्यंत पोहोचते — जे फोन-क्लास मॉडेल डेस्कटॉप-क्लास प्रतिस्पर्ध्यांपेक्षा लक्षणीय अंतरावर ठेवतात.
चेतावणी आणि संदर्भ
हे डेव्हलपर-रन बेंचमार्क आहेत, स्वतंत्रपणे ऑडिट केलेले परिणाम नाहीत आणि ऑर्निथ टीमने त्याच्या स्वत:च्या हार्नेस सेटिंग्ज अंतर्गत तुलना मॉडेलचे मूल्यमापन केले होते. प्रतिस्पर्धी लॅब देखील वेगवेगळ्या ट्रेड-ऑफसाठी ट्यून करतात; Kimi K3 ची DeepSWE वरची आघाडी सूचित करते की एजंटिक सॉफ्टवेअर कार्याची सीमा अजूनही लढलेली आहे. परंतु रिलीझची पूर्ण-सारणी पारदर्शकता — पाच-रन सरासरी, प्रकाशित हार्नेस कॉन्फिगरेशन्स, प्रकट सुरक्षा उपाय — स्वतंत्र पुनरुत्पादन असामान्यपणे सरळ बनवते.
समाजाचा उत्स्फूर्त प्रतिसाद मिळाला. रिलीझच्या घोषणेने हॅकर न्यूजवर काही तासांतच शंभरहून अधिक गुण मिळवले, चर्चा स्वयं-सुधारणा पद्धतीपेक्षा बेंचमार्क दाव्यांवर कमी केंद्रित झाली, ज्याचे वर्णन अनेक टिप्पणीकर्त्यांनी पुनरावृत्ती-शैलीच्या कार्य निर्मितीच्या अधिक विश्वासार्ह मुक्त अंमलबजावणींपैकी एक म्हणून केले.
ओपन-सोर्स इकोसिस्टमसाठी, ऑर्निथ-1.5 अशा क्षणी उतरते जेव्हा चीनच्या प्रयोगशाळा आणि पाश्चात्य स्वतंत्र संघांचे खुले मॉडेल कोडिंग आणि एजंटिक कार्यांवरील बंद सीमांसह अंतर पूर्ण करत आहेत. टर्मिनल-बेंचवरील आघाडीच्या बंद मॉडेलशी जुळणारे MIT-परवानाधारक कुटुंब — आणि फोन-रेडी 9B व्हेरिएंट पाठवते — ते अंतर आणखी कमी करते आणि कोणीही तपासणी, पुनरुत्पादन आणि विस्तार करू शकेल अशा प्रशिक्षण पद्धतीसह करते.
---
एआयच्या पुढे राहानवीनतम AI बातम्या, विश्लेषण आणि यश मिळवा — सर्व एकाच ठिकाणी.
अधिक AI बातम्या वाचा →