Ornith குழு Ornith-1.5 ஐ வெளியிட்டது, இது ஒரு அசாதாரண யோசனையைச் சுற்றி கட்டமைக்கப்பட்ட திறந்த-எடை மொழி மாதிரிகளின் குடும்பமாகும்: மாதிரியானது அதன் சொந்த பயிற்சி பணிகளை உருவாக்குகிறது, அதன் சொந்த சாரக்கட்டுகளை வடிவமைத்து, தொடர்ந்து இயங்கும் சுழற்சியில் அதன் சொந்த தீர்வு முயற்சிகளிலிருந்து கற்றுக்கொள்கிறது. அணியின் சொந்த மதிப்பீடுகளின்படி, ஃபிளாக்ஷிப் ஆர்னித்-1.5-397பி டெர்மினல்-பெஞ்ச் 2.1 (டெர்மினஸ்-2) இல் 86.1 மதிப்பெண்களைப் பெற்றுள்ளது, இது ஆந்த்ரோபிக்கின் கிளாட் ஓபஸ் 4.8 க்கு இணையாக 85.0 மற்றும் ஒவ்வொரு ஓப்பன் சோர்ஸ் மாடலை விடவும் ஒப்பிடக்கூடிய அளவில் உள்ளது.

இந்த வாரம் ஆர்னித் வலைப்பதிவிலும், எம்ஐடி உரிமத்தின் கீழ் ஹக்கிங் ஃபேஸிலும் வெளியிடப்பட்ட வெளியீடு, திறந்த மூல AI பந்தயத்தின் சமீபத்திய சால்வோ ஆகும், இது எல்லைப்புற ஆய்வகத்தின் பட்ஜெட் இல்லாமல் சாத்தியமற்றது என்று ஒருமுறை நினைத்த முடிவுகளைத் தொடர்ந்து அளித்தது. டெவலப்பர்கள் மற்றும் நிறுவனங்களுக்கு சமீபத்திய AI மாதிரி செய்தி முக்கியத்துவம் இரண்டு மடங்கு ஆகும்: முன்னணி மூடிய மாடலுடனான பெஞ்ச்மார்க் சமநிலை மற்றும் திறந்த மாதிரி மேம்பாடு அடுத்து எங்கு செல்கிறது என்பதைக் குறிக்கும் பயிற்சி செய்முறை.

மூன்று அளவுகள், ஒரு செய்முறை

Ornith-1.5 ஆனது மூன்று கட்டமைப்புகளில் அனுப்பப்படுகிறது: 397B-அளவுரு நிபுணர்களின் முதன்மைக் கலவை, ஒரு டோக்கனுக்கு 3B அளவுருக்களை மட்டுமே செயல்படுத்தும் 35B MoE மற்றும் iPhone மற்றும் Android சாதனங்களில் நேரடியாக இயங்கும் வகையில் வடிவமைக்கப்பட்ட "மொபைல்" மாறுபாட்டுடன் கூடிய சிறிய 9B மாடல். மூன்றும் GGUF, MLX மற்றும் NVFP4 பில்ட்களுடன் ஹக்கிங் ஃபேஸில் கிடைக்கின்றன, மேலும் மாதிரி அட்டைகள் குடும்பம் Qwen3.5 MoE கட்டமைப்பில் கட்டமைக்கப்பட்டுள்ளது என்பதைக் குறிக்கிறது.

பரம்பரை இங்கே முக்கியமானது. ஆர்னித்-1.0, இந்த ஆண்டின் தொடக்கத்தில் வெளியிடப்பட்டது, ஏஜென்டிக் கோடிங்கிற்கான "சுய சாரக்கட்டு" அணுகுமுறையை பிரபலப்படுத்தியது மற்றும் அமைதியான வெற்றி பெற்றது - அதன் 9B GGUF பில்ட் ஹக்கிங் ஃபேஸில் ஐந்து மில்லியனுக்கும் அதிகமான பதிவிறக்கங்களை பதிவு செய்துள்ளது. ஆர்னித்-1.5, சாரக்கட்டுகள் மற்றும் ரோல்அவுட்களை ஒரு முழு சுய-மேம்பாடு பைப்லைனாக மேம்படுத்துவதிலிருந்து அந்த கட்டமைப்பை விரிவுபடுத்துகிறது.

சுய முன்னேற்றக் கண்ணி, விளக்கப்பட்டது

வழக்கமான பயிற்சிக்குப் பிந்தைய பைப்லைனில், வலுவூட்டல் கற்றல் மனிதனால் நிர்வகிக்கப்பட்ட பணிகளின் நிலையான தொகுப்பிற்கு எதிராக இயங்குகிறது. அதற்கு பதிலாக Ornith-1.5 ஆனது புதிய பணிகளை முன்மொழிகிறது, ஒரு பணி சார்ந்த சாரக்கட்டையை உருவாக்குகிறது - அறிவுறுத்தல்கள், கருவிகள் மற்றும் சிக்கலைத் தாக்கப் பயன்படுத்தப்படும் சிதைவு உத்தி - பின்னர் அது கட்டிய சாரக்கட்டு மூலம் அடிக்கப்பட்ட தீர்வு வெளியீடுகளை உருவாக்குகிறது. GRPO ஐப் பயன்படுத்தி ரிவார்டு மூன்று நிலைகளிலும் மீண்டும் பரப்பப்படுகிறது, எனவே கணினி ஒரே நேரத்தில் சிறந்த பணிகள், சிறந்த சாரக்கட்டுகள் மற்றும் சிறந்த தீர்வுகளை எழுத கற்றுக்கொள்கிறது.

பணி-தலைமுறை வெகுமதி என்பது வடிவமைப்பின் இதயம். ஒவ்வொரு முன்மொழியப்பட்ட பணியும் மூன்று பெருக்கல் சிக்னல்களில் மதிப்பெண் பெறுகிறது: செல்லுபடியாகும் (சாரக்கட்டு சரியாகச் செயல்படுகிறதா மற்றும் மதிப்பிடுகிறதா?), எல்லைக் கடினத்தன்மை (மாதிரியின் அனுபவ வெற்றி விகிதம் தோராயமாக 20 சதவிகிதம் இலக்குக்கு அருகில் உள்ளது, பணிகளைச் சவாலாக வைத்திருப்பது ஆனால் கற்றுக் கொள்ளக்கூடியதா?), மற்றும் புதுமை (முன்பு உருவாக்கப்பட்ட பணிகளில் உள்ள எல்லாவற்றிலிருந்தும் இது போதுமான அளவு வேறுபட்டதா?). மாடலின் சொந்த தற்போதைய வெற்றி விகிதத்துடன் சிரமம் அளவிடப்படுவதால், மாதிரி மேம்படும்போது பாடத்திட்டம் தானாகவே அதிகரிக்கிறது.

மதிப்பீட்டின் போது வெளிப்படையான ஹேக்கிங் எதிர்ப்பு நடவடிக்கைகளையும் குழு தெரிவிக்கிறது: களஞ்சியப் படங்களிலிருந்து கிட் வரலாறு அகற்றப்படுகிறது, எனவே மாதிரிகள் முந்தைய தீர்வுகளை மீட்டெடுக்க முடியாது, மேலும் மாதிரிகள் வெளிப்புற பதில்களைப் பெறுவதைத் தடுக்க நெட்வொர்க் அணுகல் முடக்கப்பட்டுள்ளது. அனைத்து முடிவுகளும் சராசரியாக ஐந்து சுயாதீன ரன்களுக்கு மேல் இருக்கும்.

எண்கள்

ஏஜென்டிக் கோடிங்கில், ஃபிளாக்ஷிப்பின் சுய-அறிக்கை முடிவுகள் திறந்த மூல புலத்தின் மேல் பகுதியில் இருக்கும். டெர்மினல்-பெஞ்ச் 2.1 இல் டெர்மினஸ்-2 சேணம் வழியாக ஓடுகிறது, ஆர்னித்-1.5-397B இன் 86.1 விளிம்புகள் கிளாட் ஓபஸ் 4.8 (85.0), டீப்சீக்-வி4-ஃப்ளாஷ்-0731 (82.7), மற்றும் ஜிஎல்எம்-5.2 (81). கிளாட் கோட் ஹார்னெஸ் மூலம் அதே அளவுகோலில், ஓபஸ் 4.8 இன் 78.9 க்கு எதிராக ஆர்னித்-1.5 85.2 பதிவுகள். SWE-bench Verified இல், இரண்டும் திறம்பட 86.0 மற்றும் 85.8 இல் இணைக்கப்பட்டுள்ளன, கிமி K3 சற்று முன்னால் 86.2 இல் உள்ளது.

கடினமான ஏஜென்டிக் தொகுப்புகளில் இடைவெளிகள் விரிவடைகின்றன. DeepSWE இல், Ornith-1.5-397B மதிப்பெண்கள் 56.0 — GLM-5.2 இன் 46.2 ஐ விட, ஓபஸ் 4.8 (59.0) மற்றும் கிமி K3 (67.5) ஆகியவற்றுக்குப் பின்னால் இருந்தாலும். மிகவும் குறிப்பிடத்தக்க ஜம்ப் தலைமுறை: Ornith-1.0 DeepSWE இல் வெறும் 8.0 மதிப்பெண்களைப் பெற்றது, அதாவது புதிய மறு செய்கை அதே அளவுகோல் குடும்பத்தில் ஏழு மடங்கு முன்னேற்றத்தை அளிக்கிறது.

சிறிய மாதிரிகள் தங்கள் சொந்த கதையைச் சொல்கின்றன. Ornith-1.5-35B-A3B, ஒரு டோக்கனுக்கு 3B அளவுருக்களை மட்டுமே செயல்படுத்துகிறது, டெர்மினல்-பெஞ்ச் 2.1 (கிளாட் குறியீடு) இல் 68.5 மதிப்பெண்கள் மற்றும் Google இன் Gemma 4-31B க்கு 43.4 மதிப்பெண்கள் மற்றும் Meta's Muse Glimmer-30B. 9B மாடல் டெர்மினல்-பெஞ்ச் 2.1 இல் 47.0, SWE-பெஞ்ச் சரிபார்க்கப்பட்டதில் 70.6, மற்றும் GPQA டயமண்டில் 86.4 - டெஸ்க்டாப்-கிளாஸ் போட்டியாளர்களின் குறிப்பிடத்தக்க தூரத்தில் ஃபோன்-கிளாஸ் மாடலை வைக்கும் எண்கள்.

எச்சரிக்கைகள் மற்றும் சூழல்

இவை டெவலப்பர்களால் இயங்கும் அளவுகோல்கள், சுயாதீனமாக தணிக்கை செய்யப்பட்ட முடிவுகள் அல்ல, மேலும் ஒப்பீட்டு மாதிரிகள் ஆர்னித் குழுவால் அதன் சொந்த சேணம் அமைப்புகளின் கீழ் மதிப்பீடு செய்யப்பட்டது. போட்டி ஆய்வகங்களும் வெவ்வேறு வர்த்தக பரிமாற்றங்களுக்கு இசையமைக்கின்றன; DeepSWE இல் Kimi K3 இன் முன்னணி, முகவர் மென்பொருள் பணியின் எல்லை இன்னும் போட்டியிட்டதாகக் கூறுகிறது. ஆனால் வெளியீட்டின் முழு-அட்டவணை வெளிப்படைத்தன்மை - ஐந்து-ரன் சராசரிகள், வெளியிடப்பட்ட சேணம் உள்ளமைவுகள், வெளிப்படுத்தப்பட்ட பாதுகாப்புகள் - சுயாதீனமான இனப்பெருக்கம் வழக்கத்திற்கு மாறாக நேரடியானது.

சமூகத்தின் பதில் கணிசமானதாக உள்ளது. வெளியீட்டு அறிவிப்பு சில மணிநேரங்களில் ஹேக்கர் நியூஸில் நூற்றுக்கும் மேற்பட்ட புள்ளிகளை ஈர்த்தது, விவாதம் சுய-முன்னேற்ற முறையைக் காட்டிலும் முக்கிய உரிமைகோரல்களில் குறைவாக கவனம் செலுத்தியது, இது பல வர்ணனையாளர்கள் சுழல்நிலை-பாணி பணி உருவாக்கத்தின் மிகவும் நம்பகமான திறந்த செயலாக்கங்களில் ஒன்றாக விவரித்தார்.

ஓப்பன் சோர்ஸ் சுற்றுச்சூழலுக்கு, சீனாவின் ஆய்வகங்கள் மற்றும் மேற்கத்திய சுயாதீன குழுக்களின் திறந்த மாதிரிகள் குறியீட்டு மற்றும் முகவர் பணிகளில் மூடிய எல்லைகளுடன் இடைவெளியை மூடும் தருணத்தில் ஆர்னித்-1.5 இறங்குகிறது. டெர்மினல்-பெஞ்சில் ஒரு முன்னணி மூடிய மாதிரியுடன் பொருந்தக்கூடிய MIT-உரிமம் பெற்ற குடும்பம் - மற்றும் ஃபோன்-தயாரான 9B மாறுபாட்டை அனுப்புகிறது - அந்த இடைவெளியை மேலும் குறைக்கிறது, மேலும் எவரும் ஆய்வு செய்யலாம், இனப்பெருக்கம் செய்யலாம் மற்றும் நீட்டிக்கக்கூடிய பயிற்சி முறை மூலம் அதைச் செய்கிறது.

---

AIக்கு முன்னால் இருங்கள்

சமீபத்திய AI செய்திகள், பகுப்பாய்வு மற்றும் முன்னேற்றங்கள் - அனைத்தையும் ஒரே இடத்தில் பெறுங்கள்.

மேலும் AI செய்திகளைப் படிக்கவும் →