ஒரு பெரிய மொழி மாதிரி ஐந்தாம் வகுப்பைத் தாண்டிய பொருளைப் பார்க்காதபோது என்ன நடக்கும்? ஏழு ஆராய்ச்சியாளர்கள் கொண்ட குழு அந்தக் கேள்விக்கு உண்மையில் பதிலளித்தது: அவர்கள் அமெரிக்க தொடக்கப் பள்ளி பாடத்திட்டத்தில் வடிகட்டப்பட்ட கார்பஸில் புதிதாகப் பயிற்சி பெற்ற லிட்டில்லேர்னர் என்ற 5-பில்லியன் அளவுரு LLM ஐ உருவாக்கினர், பின்னர் எதையும் சோதித்தனர் - அதிக அளவுருக்கள், பயிற்சிக்குப் பிந்தைய, புத்திசாலித்தனமான மாதிரியை முன்வைக்க முடியுமா என்று. அவர்கள் தெரிவிக்கும் பதில், இல்லை என்பதே.
"LittleLearner: Language Models Under Pedagogically-Controlled Knowledge Exposure" என்ற கட்டுரை ஆகஸ்ட் 13 அன்று Fanfei Li, Jana Zeller, Manuel Prada-Corral, Thaddäus Wiedemer, Prasanna Mayilvahanan, Wieland Brell, மற்றும் Wieland Breell ஆகியோரால் arXiv க்கு சமர்ப்பிக்கப்பட்டது. ஆகஸ்ட் 16 ஆம் தேதிக்குள், 200க்கும் மேற்பட்ட ஆதரவாளர்களுடன் வேகமாக ஏறும் ஹேக்கர் செய்தி விவாதத்திற்கு உட்பட்டது, ஆராய்ச்சியாளர்கள் மற்றும் பயிற்சியாளர்கள் தொழில்துறையின் விருப்பமான அனுமானத்திற்கு என்ன அர்த்தம் என்று விவாதித்தனர் - பயிற்சிக்கு பிந்தைய பயிற்சியானது மெல்லிய காற்றில் இருந்து திறன்களை உருவாக்க முடியும். எங்களின் AI ஆராய்ச்சிக் கவரேஜில் நாம் பார்க்கும் கவனமாக, முரண்பாடான சோதனை இது.
அறிவு எல்லையுடன் கூடிய சாண்ட்பாக்ஸ்
நவீன எல்.எல்.எம்.க்கள் அடிப்படையில் எல்லாவற்றிலும் பயிற்றுவிக்கப்படுகின்றன, இது ஒரு நிரூபிக்கப்பட்ட திறமை பயிற்சியின் போது உண்மையாகக் கற்றுக் கொள்ளப்பட்டதா அல்லது சரியான தூண்டுதலால் வெளிப்படுத்தப்பட்டதா என்பதைக் கூறுவது கிட்டத்தட்ட சாத்தியமற்றது. பயிற்சி விநியோகத்தையே கட்டுப்படுத்துவதே அணியின் தீர்வாக இருந்தது. FineWeb-Edu தொடங்கி, அவர்கள் 88-பில்லியன்-டோக்கன் கார்பஸ் - லிட்டில் கரிகுலம் எனப் பெயரிடப்பட்டது - ஐந்து-நிலை வடிகட்டுதல் பைப்லைன் மூலம் 5 ஆம் வகுப்பு வரை மழலையர் பள்ளிக்கான பொதுவான தரநிலைகளுடன் சீரமைக்கப்பட்டது. கருத்துக்கள், உண்மைகள் மற்றும் சொற்களஞ்சியம் ஆகியவை தரம் 5 க்கு மேல் கற்பிக்கப்பட்டன.
இந்த கார்பஸில் அவர்கள் புதிதாக மூன்று அளவுகளில் (0.6B, 1.3B மற்றும் 5B அளவுருக்கள்) மாடல்களைப் பயிற்றுவித்தனர், ஒவ்வொன்றும் ஒரே கட்டமைப்பு மற்றும் டோக்கன் பட்ஜெட்டில் வடிகட்டப்படாத தரவுகளில் பயிற்சியளிக்கப்பட்ட பொருந்திய கட்டுப்பாட்டு மாதிரியுடன் அனுப்பப்பட்டது. இதன் விளைவாக, திறந்தநிலை மதிப்பீட்டிற்கு போதுமான சரளமாக இருக்கும் ஒரு மாதிரி - நீங்கள் ஒரு உலாவியில் ஹோஸ்ட் செய்யப்பட்ட 5B பதிப்பில் அரட்டையடிக்கலாம் - இன்னும் கூர்மையான, விளக்கக்கூடிய அறிவு எல்லை உள்ளது: இது தொடக்கப் பாடத்திட்டத்தில் இல்லை என்றால், மாதிரி அதைப் பார்த்ததில்லை.
எலிசிட்டேஷன், கையகப்படுத்தல் அல்ல
முக்கிய கண்டுபிடிப்பு அப்பட்டமாக உள்ளது: மாடல்களை சிறந்ததாக மாற்றுவதற்கான நிலையான கருவித்தொகுப்பு லிட்டில்லேனர் ஏற்கனவே அறிந்ததை பெருக்கியது, ஆனால் அது எதுவுமே நோக்கத்திற்கு வெளியே செயல்திறனை அர்த்தமுள்ளதாக மேம்படுத்தவில்லை.
அளவிடுதல் மாதிரியின் கட்டுப்படுத்தப்பட்ட அறிவிற்குள் துல்லியத்தை மேம்படுத்தியது மற்றும் அதே கற்றல் பாதையில் அடக்கமாக நீட்டிக்கப்பட்டது, ஆனால் தரம்-5 உள்ளடக்கத்திற்கு அப்பால் திறன்கள் தேவைப்படும் சிக்கல்களுக்குச் சிறிதும் செய்யவில்லை. GRPO உடனான பிந்தைய பயிற்சி - பகுத்தறிவு-மாதிரி ஏற்றத்தின் பின்னால் உள்ள வலுவூட்டல்-கற்றல் முறை --நோக்கத்தில் K-5 திறன்களை கணிசமாக உயர்த்தியது, ஆனால் நோக்கம் இல்லாத தரவுகளுடன் பயிற்சி பெற்றபோதும்-K-5 திறன்களைத் தாண்டி மீட்க முடியவில்லை. மேலும் சூழல் கற்றல், அறிவை ஒரு ப்ராம்ட்டில் திணிக்கும் தினசரி மந்திரம், மாடல் தன்னிடம் உள்ளதைப் பயன்படுத்த உதவியது, ஆனால் எல்லைக்கு அப்பால் புதிய பகுத்தறிவைத் திறக்கவில்லை.முன் பயிற்சி வடிகட்டி, சுருக்கமாக, பயனுள்ள திறன் உச்சவரம்பு அமைக்கிறது. புலம் தொடர்ந்து மங்கலாக்கும் ஒரு வேறுபாட்டிற்கான சான்றாக ஆசிரியர்கள் முடிவை வடிவமைக்கின்றனர்: பயிற்சிக்குப் பிந்தைய மற்றும் தூண்டுதல்; முன் பயிற்சி பெறுகிறது.
சுத்தமான கட்டுப்பாடுகள், பொது சோதனைச் சாவடிகள்
முறையானது கோரிக்கைகளுக்கு அவற்றின் வலிமையை அளிக்கிறது. ஒவ்வொரு LittleLearner மாதிரியும் பொருந்தாத வடிகட்டப்படாத கட்டுப்பாட்டுடன் அனுப்பப்படுவதால் - அதே கட்டிடக்கலை, அதே டோக்கன் எண்ணிக்கை, அதே பயிற்சி செய்முறை - பாடத்திட்ட வடிப்பானில் மட்டுமே குழு எந்த நடத்தை வேறுபாட்டையும் கூற முடியும். MathCAMPS பெஞ்ச்மார்க்கில் பயிற்சி பெற்ற கணித வல்லுநர்கள், ஆராய்ச்சியாளர்கள் செயல்திறனை பள்ளி தரத்தின்படி தரப்படுத்த அனுமதிக்கிறார்கள், நோக்கம் திறன் எங்கு முடிவடைகிறது என்பதைக் கண்டறியவும். மேலும் பெரும்பாலான எல்லைத் தாள்களைப் போலல்லாமல், அனைத்தும் பொதுவில் உள்ளன: கார்பஸ், ஹக்கிங்ஃபேஸில் உள்ள மூன்று அளவீடுகளிலும் அடிப்படை மற்றும் பின் பயிற்சி பெற்ற சோதனைச் சாவடிகள் மற்றும் ஹோஸ்ட் செய்யப்பட்ட அரட்டை டெமோ, எனவே சுயாதீன குழுக்கள் எல்லையை தாங்களாகவே ஆய்வு செய்யலாம்.
அந்த வெளிப்படைத்தன்மை ஹேக்கர் நியூஸ் விவாதத்தை தூண்டுகிறது. வர்ணனையாளர்கள் ஹோஸ்ட் செய்யப்பட்ட மாதிரியின் நடத்தையை அதன் அறிவின் விளிம்பில் சோதித்து வருகின்றனர் - அது 5 ஆம் வகுப்புக்கு மேல் தள்ளப்பட்டாலும், யூகங்களைத் தவிர்ப்பது, அல்லது மாயத்தோற்றம் போன்றது - மற்றும் தாக்கங்களைப் பற்றி வாதிடுகிறது: சிலர் முடிவுகளை பகுத்தறிவு-மாடல் மிகைப்படுத்தலுக்கான மோசமான செய்தியாகப் படிக்கிறார்கள், மற்றவர்கள் வலை அளவிலான முன் பயிற்சி தரவுகள் தொடக்கப் பள்ளி மாதிரிகளின் உயர் உச்சவரம்புக் கருத்துக்களைக் காட்டிலும் அதிகம் என்று சுட்டிக்காட்டுகின்றனர். கட்டுரையின் ஆசிரியர்களே இந்த விஷயத்தில் கவனமாக இருக்கிறார்கள்: அவர்களின் கூற்று என்னவென்றால், அறியப்பட்ட, கட்டுப்படுத்தப்பட்ட கல்வியைக் கொண்ட ஒரு மாதிரிக்கு நிலையான தலையீடுகளால் என்ன செய்ய முடியவில்லை என்பது பற்றியது, எல்லைப்புற ஆய்வகங்களைப் பற்றிய நேரடி கணிப்பு அல்ல.
வகுப்பறைக்கு அப்பால் இது ஏன் முக்கியமானது
AI இல் நேரடி விவாதங்களுக்கு நேரடியாகச் சோதனை பேசுகிறது. AI ஆய்வகங்கள் பயிற்சிக்குப் பிந்தைய விதிமுறைகளுக்கு பில்லியன்களை செலவழிக்கின்றன. லிட்டில்லேர்னர் அந்த ஆதாயங்கள் பெரும்பாலும் வாழலாம் - மற்றும் முன் பயிற்சி தரவு என்ன ஆதரிக்கிறது என்பதை வரையறுக்கிறது. டேட்டா க்யூரேஷனைப் பற்றி அதிகம் அக்கறை கொள்வதற்கும், "எமர்ஜென்ட்" பிந்தைய பயிற்சி திறன்களின் கூற்றுகளை சந்தேகத்துடன் நடத்துவதற்கும் இது ஒரு வாதமாகும்.
வெளியீடு ஒரு உண்மையான ஆய்வுக் கருவியாகும், வெறும் காகிதம் மட்டுமல்ல. குழு LittleCurriculum மற்றும் அனைத்து மாதிரி சோதனைச் சாவடிகளையும் வெளிப்படையாக வெளியிட்டது, மேலும் திட்டப் பக்கம் சாண்ட்பாக்ஸ் செயல்படுத்தும் சோதனைகளை வரைகிறது: RL உண்மையிலேயே திறமையை வெகுமதியாக உருவாக்க முடியுமா, ஒரு மாதிரி-திறனுடன், எதிர்மறை எண்கள் போன்ற உண்மையான புதிய கருத்தை அறிமுகப்படுத்தும் போது, மற்றும் இயந்திரங்களும் குழந்தைகளும் ஒரே மாதிரியான வெளிப்பாடு தேவையா - அல்லது இதே போன்ற தவறுகளைச் செய்யும்போது.
அரிதாகவே சுத்தமான கட்டுப்பாடுகளைப் பெறும் ஒரு துறைக்கு, வெளிப்படையாகக் குறிப்பிடப்பட்ட கல்வியுடன் கூடிய மாதிரி ஒரு அரிய பரிசு. மற்ற அனைவருக்கும், இது மேசைக்கு மேலே பொருத்த வேண்டிய ஒரு நினைவூட்டலாகும்: எந்த மாதிரியும் - அல்லது நபரும் - அவர்கள் ஒருபோதும் கற்பிக்கப்படாதவற்றிலிருந்து வெளியேற முடியாது.
AIக்கு முன்னால் இருங்கள்
AIயை மறுவடிவமைக்கும் ஆராய்ச்சியின் சக மதிப்பாய்வு தர கவரேஜ், தினமும் வழங்கப்படுகிறது. சமீபத்திய AI மேம்பாடுகளுக்கு எங்கள் மையத்தை புக்மார்க் செய்யவும்.
மேலும் AI செய்திகளைப் படிக்கவும் →