டெவின் AI மென்பொருள் பொறியாளருக்குப் பின்னால் உள்ள நிறுவனமான அறிவாற்றல், SWE-2 ஐ வியாழக்கிழமை அறிமுகப்படுத்தியது, இது இன்னும் மேம்பட்ட குறியீட்டு மாதிரி என்று விவரிக்கிறது. செப்டம்பர் 10 அன்று வெளியிடப்பட்ட ஒரு வலைப்பதிவு இடுகையில், நிறுவனம் புதிய மாடல் திறன் மற்றும் செலவின் Pareto எல்லை என்று அழைக்கப்படுவதைத் தள்ளுகிறது, FrontierCode 1.1 முதன்மை அளவுகோலில் 50.0% மதிப்பெண்களைப் பெற்றுள்ளது, அதே நேரத்தில் Fable 5.1 ஐ விட 64% குறைவான விலையில் உள்ளது, இது ஒரு புள்ளியில் முன்னால் இருக்கும் 50%. 50.

அறிவாற்றல் நிறுவனம் $48 பில்லியன் மதிப்பீட்டில் $2 பில்லியன் நிதியுதவியை உறுதிசெய்த ஒரு நாளுக்குப் பிறகு தொடங்கப்பட்டது, மேலும் ஏஜென்டிக் குறியீட்டு தொடக்கமானது மூன்றாம் தரப்பு எல்லை மாதிரிகளை மட்டும் நம்பாமல் அதன் சொந்த மாதிரி வளர்ச்சியில் எவ்வளவு தீவிரமாக முதலீடு செய்கிறது என்பதை இது குறிக்கிறது. AI குறியீட்டு பந்தயத்தின் தொடர்ச்சியான கவரேஜ் மற்றும் தொழில்துறையை நகர்த்தும் மற்ற அனைத்திற்கும், புக்மார்க் AI Buzz Wire, AI செய்திகளை வெளியிடுவதற்கான உங்கள் தினசரி ஆதாரம்.

SWE-2 தரவரிசையில் இறங்கும் இடம்

காக்னிஷனின் வெளியிடப்பட்ட முடிவுகளின்படி, SWE-2 ஆனது FrontierCode 1.1 Main இல் 50.0% இடுகையிடுகிறது, Grok 4.6 ஐ விட 48.0% மற்றும் GPT-5.6 Sol ஐ விட 47.5%, மற்றும் GPT-6 Astra இன் ஸ்டிரைக்கிங் தூரத்தில் 53.3% இல் முன்னணியில் உள்ளது. DeepSWE 1.1 அளவுகோலில், SWE-2 73.0% ஐ அடைகிறது, அஸ்ட்ராவின் 74.1% மாதிரிகள் அறிவாற்றல் பட்டியல்களில் இரண்டாவது இடத்தில் உள்ளது.

டெர்மினல்-பெஞ்ச் 2.1 இல் வலுவான காட்சி வருகிறது, அங்கு SWE-2 மதிப்பெண்கள் 92.8% ஆகும், இது அறிவாற்றலின் ஒப்பீட்டு அட்டவணையில் மிக உயர்ந்த எண்ணிக்கை மற்றும் ஃபேபிள் 5.1 ஐ விட 91.4% மற்றும் GPT-6 அஸ்ட்ரா 89.9%. கடினமான டெர்மினல்-பெஞ்ச் 4 இல் படம் மாறுகிறது, அங்கு SWE-2 ஆனது GPT-6 அஸ்ட்ராவிற்கு 57.9% மற்றும் ஃபேபிள் 5.1 க்கு 55.8% க்கு எதிராக 27.3% நிர்வகிக்கிறது, இது மாதிரியின் செயல்திறன்-முதல் வடிவமைப்பு பணி சிரமத்தின் உச்சக்கட்டத்தில் தலையிடுகிறது என்பதை நினைவூட்டுகிறது.

அறிவாற்றல் நிலைப்படுத்தலை அப்பட்டமாகத் தொகுக்கிறது: FrontierCode 1.1 Main மற்றும் DeepSWE 1.1 இல், SWE-2 அதன் முந்தைய மாதிரியான SWE-1.7 மற்றும் Grok 4.6 ஆகியவற்றை மதிப்பெண் மற்றும் செலவு இரண்டிலும் முறியடித்து, GPT-5.6 Sol மற்றும் Fable 5/5.1 உடன் பொருந்துகிறது மற்றும் அவற்றின் விலை 6-ன் ஒரு சில பகுதிக்குள் ஜி.பி. செலவு.

மல்டி டிரில்லியன் ஸ்கேலில் கிமி கே3 இலிருந்து பயிற்சிக்குப் பின்

SWE-2 புதிதாக உருவாக்கப்படவில்லை. மூன்ஷாட் AI இலிருந்து 2.8-டிரில்லியன் அளவுரு அடிப்படை மாதிரியான கிமி K3 இலிருந்து மாடலை அறிவாற்றல் பிந்தைய பயிற்சி பெற்றது. அந்த அடித்தளத்தின் மேல், அறிவாற்றல் அதன் RL செயல்முறை பல வரையறைகளில் ஐந்து முதல் ஆறு புள்ளிகளைச் சேர்த்தது மற்றும் K3 இன் முழு செலவு-செயல்திறன் எல்லையையும் மாற்றியது.

SWE-1.7 க்காக உருவாக்கப்பட்ட பயிற்சி உள்கட்டமைப்பு மற்றும் செய்முறையை உருவாக்கி, பல-டிரில்லியன்-அளவுரு ஆட்சிக்கு வலுவூட்டல் கற்றலை அளவிடுவது SWE-2 முதல் முறையாகும் என்று நிறுவனம் கூறுகிறது. முக்கிய சேர்த்தல் RL அல்காரிதம் ஆகும், இது அனைத்து பகுத்தறிவு-முயற்சி நிலைகளையும் ஒரே ஓட்டத்தில் பயிற்றுவிக்கிறது, மாறாக குறைந்த, நடுத்தர மற்றும் அதிக முயற்சியை தனி பயிற்சி இலக்குகளாகக் கருதுவதை விட.

செலவு அபராதங்கள் முழு எல்லையையும் வடிவமைக்கின்றன

SWE-2 இன் பயிற்சியின் ஒரு மைய யோசனையானது, ஒரு RL ரன்னில் ஒரு முயற்சியின் அளவிற்கான நேரியல் செலவு அபராதம் ஆகும், ஒவ்வொரு அபராதமும் அடிப்படை மாதிரியின் Pareto எல்லையின் உள்ளூர் சாய்வுக்கு ஏற்றது. முதல் கொள்கைகளிலிருந்து பெறப்பட்ட இந்த அணுகுமுறை, மாதிரியின் முழுச் செலவு-செயல்திறன் எல்லையையும் அதன் வடிவத்தைப் பாதுகாத்து, பயிற்சியில் முடிந்தவரை நேரடியாக உண்மையான பயனர் செலவுகளைப் பிரதிபலிக்கிறது என்று அறிவாற்றல் கூறுகிறது.

நிறுவனம் SWE-1.6 முதல் பயன்படுத்திய நீளம் கொண்ட வெகுமதி பேஸ்லைனையும் விவரித்துள்ளது, இது டிகோடிங் செயல்திறனை உயர்த்துவதற்கான ஆன்லைன் வரைவு மாதிரியை உள்ளடக்கிய RL ரோல் அவுட் சேவையின் மேம்பாடுகளுடன், கணிசமாக நிலைப்படுத்தப்பட்ட பயிற்சியுடன் இது வரவு வைக்கிறது. NVFP4 மற்றும் FP8 கர்னல்கள் மற்றும் அளவீடு-விழிப்புணர்வு பயிற்சியுடன், அடிப்படை மாதிரியானது அதன் முன்னோடியின் அளவுருக்களை விட கிட்டத்தட்ட மூன்று மடங்குகளைக் கொண்டிருந்தாலும் ஒட்டுமொத்த நினைவகப் பயன்பாட்டைக் குறைத்ததாக அறிவாற்றல் கூறுகிறது.

பயிற்சி தரவு பைப்லைன் மேலும் விரிவடைந்தது: அறிவாற்றல் RL சூழல்களின் எண்ணிக்கையை மூன்று மடங்காக உயர்த்தியது, அறிவுறுத்தல்-பின்வரும் மேலடுக்குகளைச் சேர்த்தது, மேலும் முந்தைய SWE-2 சோதனைச் சாவடிகளால் இயக்கப்படும் ஒரு ஃப்ளைவீலை உருவாக்கியது.

அறிவுத்திறனைப் போலவே செயல்திறன்

அறிவாற்றல் SWE-2 இன் ஆதாயங்களை செயல்திறனுடன் நெருக்கமாக இணைக்கிறது. வலுவான பொறியியல் தீர்ப்பு, குறைவான மாற்றுப்பாதைகள் மற்றும் தேவையற்ற வாசிப்புகளுடன் முழுமையான தீர்வுகளை எழுத ஏஜென்ட்டை அனுமதிக்கிறது என்று நிறுவனம் கூறுகிறது. FrontierCode 1.1 Main இல், SWE-2 இன் நடுத்தர-முயற்சி உள்ளமைவு SWE-1.7 ஐ விட அதிகமாக உள்ளது, அதே நேரத்தில் 58% குறைவான திருப்பங்களை எடுத்து 81% குறைவாக செலவாகும்.

அறிவாற்றலின் வணிகத்திற்கு அந்த ஃப்ரேமிங் முக்கியமானது. டெவின் ஒரு தன்னாட்சி மென்பொருள் பொறியாளராக விற்கப்படுகிறார், மேலும் அனுமான செலவு என்பது விலை மற்றும் விளிம்புகளுக்கு நேரடி உள்ளீடு ஆகும். ஒவ்வொரு பணிக்கும் திருப்பங்கள் மற்றும் டோக்கன்களை வெட்டும் போது எல்லையை ஒட்டிய தரத்தை வைத்திருக்கும் ஒரு மாதிரி நிறுவனம் சேவை செய்யும் ஒவ்வொரு டெவின் அமர்வின் பொருளாதாரத்தையும் மாற்றுகிறது.

கிடைக்கும்

SWE-2 இன்று முதல் டெவின் டெஸ்க்டாப் மற்றும் டெவின் சிஎல்ஐயில் கிடைக்கிறது, டெவின் வெப் மற்றும் ஃப்யூஷனில் வெளியீடு நடந்து வருவதாக நிறுவனம் தெரிவித்துள்ளது. வரவிருக்கும் நாட்களில் மேற்பரப்பு முழுவதும் மாதிரி தோன்றுவதை பயனர்கள் பார்க்க வேண்டும் என்று அறிவாற்றல் கூறுகிறது.

குறியீட்டு மாதிரி சந்தைக்கு என்ன அர்த்தம்

வெளியீடு GPT-6 அஸ்ட்ராவுக்குப் பின்னால் ஏற்கனவே நெரிசலான தொகுப்பை இறுக்குகிறது. அறிவாற்றல் இப்போது ஆந்த்ரோபிக், ஓபன்ஏஐ மற்றும் எக்ஸ்ஏஐ ஆகியவற்றிலிருந்து குறைந்த விலையில் சலுகைகளை வர்த்தகம் செய்யும் ஒரு மாதிரியை வைத்திருக்கிறது, மேலும் இது மாடலில் இருந்து முகவர் தயாரிப்பு வரை முழு அடுக்கையும் கட்டுப்படுத்துகிறது. போட்டியாளர்கள் திறனைப் போலவே விலையிலும் பதிலளிக்க வேண்டிய அழுத்தத்தை எதிர்கொள்வார்கள், குறிப்பாக SWE-2 இன் விலை விவரம் வலுவாக இருக்கும் அதிக அளவு, நடுத்தர-சிரமமான பணிகளுக்கு.

AI குறியீட்டு கருவிகளை வாங்குபவர்களுக்கு, எல்லை-நிலை குறியீட்டு உதவிக்கு எல்லை-நிலை விலை நிர்ணயம் தேவைப்படாது என்பது நடைமுறையில் எடுத்துக்கொள்ளப்படும். மற்ற தொழில்துறையினருக்கு, SWE-2 ஆனது, பயிற்சிக்கு பிந்தைய மற்றும் உள்கட்டமைப்பு திறன், அடிப்படை மாதிரி அளவு மட்டுமல்ல, ஒரு தீர்க்கமான போட்டி நெம்புகோலாக மாறியுள்ளது.

---

AIக்கு முன்னால் இருங்கள்

சமீபத்திய AI செய்திகள், பகுப்பாய்வு மற்றும் முன்னேற்றங்கள் - அனைத்தையும் ஒரே இடத்தில் பெறுங்கள்.

மேலும் AI செய்திகளைப் படிக்கவும் →