40% குறைவான டோக்கன்களை வெளியிடும் போது Moonshot AI இன் Kimi K3 போன்ற அதே பதில்களை உருவாக்கும் என்று நிறுவனம் கூறும் சிறப்பு மாதிரியான Ember-1 ஐ அறிமுகப்படுத்தியுள்ளது. செப்டம்பர் 23 அன்று இந்த மாடல் பட்டாசு மேடையில் நேரலைக்கு வந்தது, மேலும் கடந்த சில நாட்களாக இது டெவலப்பர் சமூகத்தில் அதிகம் விவாதிக்கப்பட்ட வெளியீடுகளில் ஒன்றாக மாறியுள்ளது, இது ஹேக்கர் நியூஸில் நூற்றுக்கணக்கான ஆதரவைப் பெற்றுள்ளது.
மாதிரித் திறன் அல்ல, அனுமான பில்கள், அணிகள் எதைக் கப்பல் செய்ய முடியும் என்பதைத் தீர்மானிக்கும் தருணத்தில் பிட்ச் வருகிறது. ஏஜென்டிக் பணிச்சுமைகளைப் பார்க்கும் குழுக்களுக்கு, சமீபத்திய AI வளர்ச்சிகள் ஒரு விஷயத்தை தெளிவுபடுத்தியுள்ளது: தற்போது தொழில்துறையின் மிகவும் விலையுயர்ந்த பழக்கம் எல்லை மாடல்களைப் பயிற்றுவிப்பதில்லை, அது அவற்றை இயக்குகிறது. Ember-1 என்பது அந்தச் சிக்கலை நேரடியாகத் தாக்கும் பட்டாசுகளின் முயற்சியாகும், மேலும் நிறுவனம் வழக்கத்திற்கு மாறாக விரிவான அளவுகோல் மற்றும் உற்பத்தி எண்களுடன் அதை ஆதரித்தது.
சிந்தனை மாதிரிகள் அதிகமாக சிந்திக்கிறார்கள்
Ember-1 க்குப் பின்னால் உள்ள முக்கிய அவதானிப்பு என்னவென்றால், Kimi K3 போன்ற பகுத்தறிவு மாதிரிகள் அவற்றின் உருவாக்கப்படும் டோக்கன்களில் பெரும்பாலானவை - சில நேரங்களில் 90% க்கும் அதிகமானவை, பட்டாசுகளின் படி - பதிலைக் காட்டிலும் உள் காரணங்களுக்காக செலவிடுகின்றன. ஒரு கோரிக்கையில், அது விலை உயர்ந்தது. ஏஜென்டிக் பணிச்சுமைகளில், இது ஒருங்கிணைக்கிறது: ஒரு முகவர் உரையாடலின் ஒவ்வொரு திருப்பமும் அனைத்து முந்தைய பகுத்தறிவுகளையும் மாதிரிக்கு மீண்டும் இயக்குகிறது, எனவே சூழல் சுழற்சிகளின் எண்ணிக்கையுடன் தோராயமாக இருபடியாக வளர்கிறது, மேலும் ஆரம்ப திருப்பங்களில் இருந்து நீண்ட பகுத்தறிவு தடயங்கள் மீண்டும் படிக்கப்பட்டு ஒவ்வொரு அடுத்தடுத்த அழைப்பிலும் மீண்டும் கட்டணம் செலுத்தப்படுகின்றன.
குறைந்த செலவில் கிமி கே3 இன் குறியீட்டுத் திறனைத் தாங்கள் விரும்புவதாக வாடிக்கையாளர்கள் தங்களிடம் கூறியதாக பட்டாசு கூறுகிறது, ஆனால் மாடலின் பகுத்தறிவு முயற்சியை வெறுமனே நிராகரிப்பது பலனளிக்கவில்லை - குறைந்த-முயற்சி அமைப்புகள் அதிக தரத்தை விட்டுக் கொடுத்தன. முக்கியமான பகுத்தறிவை வைத்துக்கொண்டு மிகவும் திறமையாகக் காரணமான ஒரு மாதிரியைப் பயிற்றுவிப்பதே மாற்றாக இருந்தது.
கழிவுகளை வெளியேற்ற பயிற்சி
பில்டிங் எம்பர்-1 50 க்கும் மேற்பட்ட பயிற்சி பரிசோதனைகள் மற்றும் 200 க்கும் மேற்பட்ட மதிப்பீடுகளை எடுத்தது, இது முழுக்க முழுக்க பட்டாசுகளின் சொந்த சர்வர்லெஸ் பயிற்சி தளத்தில் இயங்குகிறது என்று நிறுவனத்தின் வலைப்பதிவு இடுகை கூறுகிறது. துல்லியத்தை இழக்காமல் பகுத்தறிவைக் குறைக்க புதிய பயிற்சி வழிமுறைகளை உருவாக்கியதாக குழு கூறுகிறது.
பகுத்தறிவு மொத்த விற்பனையை அகற்ற நிறுவனம் முயற்சிக்கவில்லை என்பது குறிப்பிடத்தக்கது. Kimi K3 இன் வெளிப்படையான சொற்களஞ்சியத்தில் சில உற்பத்தி சுய-பிரதிபலிப்பு - ஒரு அனுமானத்தை மறுபரிசீலனை செய்தல், பின்னூட்டங்களுக்கு பதிலளிப்பது அல்லது முந்தைய முடிவைத் திரும்பப் பெறுவது மாதிரி தவறுகளிலிருந்து மீள உதவுகிறது. பயிற்சி முறையானது உற்பத்தி செய்யாத சுழல்களை ஒழுங்கமைக்கும்போது அந்த திறனைப் பாதுகாக்க வடிவமைக்கப்பட்டுள்ளது.
பயிற்சி தரவு கணிதம், குறியீட்டு முறை, அறிவுறுத்தல், உரையாடல், தேடல், கருவி பயன்பாடு மற்றும் மென்பொருள் பொறியியல் ஆகியவற்றை உள்ளடக்கியது, தனித்தனி சிக்கல்கள் மற்றும் நீட்டிக்கப்பட்ட பல-திருப்பு தொடர்புகள் இரண்டையும் உள்ளடக்கியது. பட்டாசு தனது சொந்த தரவை மட்டுமே பயன்படுத்தியது என்றும் வாடிக்கையாளர் தரவு இல்லை என்றும் கூறுகிறது.
வரையறைகள்: பரேட்டோ எல்லையில் அல்லது அருகில்
கிமி கே3யின் பொது ஏபிஐ விலையைப் பயன்படுத்தி பட்டாசுகள் ஒரு பெஞ்ச்மார்க் விலையைக் கணக்கிட்டன - ஒரு மில்லியனுக்கு சேமிக்கப்படாத உள்ளீட்டு டோக்கன்களுக்கு $3, தற்காலிக சேமிப்பில் உள்ள இன்புட் டோக்கன்களுக்கு $0.30, மற்றும் ஒரு மில்லியன் வெளியீட்டு டோக்கன்களுக்கு $15 - மற்றும் குறைந்த, அதிக மற்றும் அதிகபட்ச பகுத்தறிவு முயற்சியில் எம்பர்-1 ஐ ஒப்பிடுகிறது. 50 க்கும் மேற்பட்ட சோதனை மாதிரிகளைக் கொண்ட ஒவ்வொரு அளவுகோலிலும், எம்பர்-1 பரேட்டோ எல்லையில் அல்லது அதற்கு அருகில் அமர்ந்திருப்பதாக நிறுவனம் தெரிவிக்கிறது, அதிகபட்ச முயற்சியில் K3 ஐப் பொருத்துகிறது மற்றும் குறைந்த முயற்சியில் கண்டிப்பாக ஆதிக்கம் செலுத்துகிறது.
பட்டாசு அறிக்கையின்படி, அதிகபட்ச முயற்சியில் K3க்கு எதிரான தலைப்பு ஒப்பீடுகள்:
| அளவுகோல் | மாதிரிகள் | K3 (அதிகபட்ச முயற்சி) | எம்பர்-1 |
|---|---|---|---|
| டெர்மினல் பெஞ்ச் 2.1 | 89 | 80.9% | 82.0% |
| SWE-பெஞ்ச் சரிபார்க்கப்பட்டது | 500 | 93.2% | 92.2% |
| SWE-இன்டராக்ட் | 75 | 21.3% | 20.0% |
| DeepSWE 1.1 | 113 | 66.4% | 75.2% |
| τ²-பெஞ்ச் ஏர்லைன் | 50 | 64% | 66% |
ஒரு பணிக்கான செலவில், வானவேடிக்கை அறிக்கைகள் Ember-1 டெர்மினல் பெஞ்ச் 2.1 இல் 51.9%, SWE-Interact இல் 32.5%, DeepSWE 1.1 இல் 23.7%, மற்றும் SWE-பெஞ்சில் 15.5% ஆகியவை K3 உடன் ஒப்பிடும்போது சரிபார்க்கப்பட்ட அதிகபட்ச முயற்சியில் $1 யூனிட், டீப் 1 யூனிட் டீப்பை விட அதிகமாக இருந்தால் நிறுவனத்தின் கணக்கிடப்பட்ட விகிதங்கள்.
நிறுவனம் டாக்ஸிமிட்டியின் பெட்சைட் பெஞ்சில் எம்பர்-1ஐ மதிப்பீடு செய்தது, இது 10 சிறப்புகளில் 500 மருத்துவ வழக்குகளின் மருத்துவரால் சரிபார்க்கப்பட்ட அளவுகோலாகும், இது புதிதாக அறிமுகப்படுத்தப்பட்ட சிறப்பு நுண்ணறிவு குறியீட்டின் மூலம் பட்டாசு இயங்குகிறது. அங்கு, GPT-5.6 Sol, GPT-6 Astra மற்றும் Claude Opus 5 உள்ளிட்ட திறந்த மற்றும் மூடிய மாடல்களில் ஒரு பணிக்கான செலவில் Ember-1 ஒரு புதிய Pareto எல்லையை அமைத்துள்ளது என்று பட்டாசு கூறுகிறது.
நேரலை போக்குவரத்து: குறைவான டோக்கன்கள், அதே மதிப்பெண்கள்
வரையறைகள் ஒரு விஷயம்; உற்பத்தி வேறு. பட்டாசுகள் இரண்டு வாடிக்கையாளர்களுடன் தங்கள் உற்பத்தி குறியீட்டு பணிச்சுமைகள் குறித்து நேரடி A/B சோதனைகளை நடத்தியது மற்றும் Ember-1 ஒப்பிடக்கூடிய தரத்தில் ஒரு பணிக்கு தோராயமாக 35% குறைவான டோக்கன்களைப் பயன்படுத்தியதாகத் தெரிவிக்கிறது. ஒரு அளவிடப்பட்ட ஒப்பீட்டில், Kimi K3 ஒரு பணிக்கு 49,300 அவுட்புட் டோக்கன்களை உருவாக்கும் போது 0.751 மதிப்பெண்களைப் பெற்றது, 29,900 டோக்கன்களில் Ember-1 க்கு 0.753 க்கு எதிராக - நியாயமான டோக்கன்களில் 71.3% குறைப்பு மற்றும் மொத்த டோக்கன்கள் 39% குறைவு. சோதனைகளைத் தொடர்ந்து, ஒரு வாடிக்கையாளர் எம்பர்-1ஐ நேரடித் தயாரிப்பிற்கு மாற்றினார், அடிப்படை மாதிரியை முழுவதுமாக மாற்றுவதற்கு அதை அளவிட திட்டமிட்டுள்ளார்.
பட்டாசுகளுக்குள்ளேயே, இந்த மாடல் வெளியிடப்படுவதற்கு முன்பு நிறுவனத்தின் சொந்த குறியீட்டு பணிப்பாய்வுகளில் அமைதியாக மாற்றப்பட்டது. அதன் முடிவு பெருமைக்குரியது என்று குழு கூறுகிறது: யாரும் கவனிக்கவில்லை. டெவலப்பர்கள் கணிசமாக குறைவான டோக்கன்களைப் பயன்படுத்தும் போது சுவிட்சைக் கண்டறியாமல் தங்கள் வேலையைச் செய்தனர்.
ஒரு உத்தியாக சிறப்பு நுண்ணறிவு
Ember-1 என்பது பட்டாசு ஆராய்ச்சியின் திட்டமிடப்பட்ட தொடரின் முதல் மாடலாகும், மேலும் இது நிறுவனத்தின் சிறப்பு நுண்ணறிவு குறியீட்டுடன் வருகிறது, இது நிபுணர்களால் உருவாக்கப்பட்ட நிஜ-உலகப் பணிகளில் திறந்த, மூடிய மற்றும் சிறப்பு மாதிரிகளை ஒப்பிடுவதற்கு இந்த மாத தொடக்கத்தில் அறிமுகப்படுத்தப்பட்ட தரப்படுத்தல் முயற்சியாகும்.
மூலோபாய நாடகம் படிக்க எளிதானது. புதிதாக ஒரு எல்லை மாடலைப் பயிற்றுவிப்பதற்குப் பதிலாக, பட்டாசு ஒரு வலுவான திறந்த-எடை மாடலை எடுத்து, அதில் டோக்கன் செயல்திறனைப் பயிற்றுவித்தது, இப்போது அதே திறனை ஒரு பணிக்கு குறைந்த விலையில் விற்பனை செய்கிறது. மூன்ஷாட் போன்ற ஆய்வகங்களின் திறந்த-எடை வெளியீடுகள் திறன் இடைவெளியை மூடிக்கொண்டே இருப்பதால், லீடர்போர்டு நிலையைக் காட்டிலும் முடிக்கப்பட்ட பணிக்கான செலவில் நீடித்த வேறுபாடு இருக்கலாம் என்பதை அனுமான வழங்குநர்கள் கண்டுபிடித்துள்ளனர் - இது வலுவான பயிற்சி மற்றும் சேவை உள்கட்டமைப்பைக் கொண்ட நிறுவனங்களுக்கு சாதகமாக இருக்கும்.
எச்சரிக்கைகளை தெளிவாகக் குறிப்பிடுவது மதிப்பு: மேலே உள்ள எண்கள் பட்டாசுகளின் சொந்த வலைப்பதிவு, அதன் சொந்த மதிப்பீடுகள் மற்றும் அதன் சொந்த பணம் செலுத்தும் வாடிக்கையாளர்களிடமிருந்து வந்தவை. வெளிப்புற பணிச்சுமைகளில் டோக்கன் சேமிப்பின் சுயாதீன பிரதிபலிப்பு உண்மையான சோதனையாக இருக்கும். ஆனால் முடிவுகள் இருந்தால், ஒரு எல்லைப்புற-வகுப்பு திறந்த மாதிரியை இயக்குவதற்கான மிகவும் செலவு குறைந்த வழி இனி அதை குறைவாக சிந்திக்க வைக்காது - திறமையாக சிந்திக்க கற்றுக்கொண்ட மாதிரியை இயக்குவது.
---
சமீபத்திய AI செய்திகள், பகுப்பாய்வு மற்றும் முன்னேற்றங்கள் - அனைத்தையும் ஒரே இடத்தில் பெறுங்கள்.
மேலும் AI செய்திகளைப் படிக்கவும் →