பரவலாக்கப்பட்ட AI ஆய்வக பிரைம் இன்டெலெக்ட், இன்றைய எல்லைப்புற AI மாதிரிகள் தன்னாட்சி இயந்திர கற்றல் ஆராய்ச்சியை எவ்வளவு சிறப்பாகச் செய்ய முடியும் என்பதைச் சோதிக்கும் ஒரு பெரிய அளவிலான பரிசோதனையின் முடிவுகளை வெளியிட்டுள்ளது - மேலும் அவற்றில் மிகச் சிறந்தவை, புகழ்பெற்ற சமூக அளவுகோலில் மனித உலக சாதனையைப் பொருத்துவதற்கு குறிப்பிடத்தக்க வகையில் நெருக்கமாக வந்துள்ளன.
NanoGPT Speedrun Frontier என பெயரிடப்பட்டு ஆகஸ்ட் 22 அன்று வெளியிடப்பட்ட இந்தத் திட்டம், nanoGPT ஆப்டிமைசர் ஸ்பீட்ரனை முயற்சிக்கும் 18 எல்லை மாடல்களில் 153 தன்னாட்சி ஓட்டங்களைக் கொண்டிருந்தது - இது ஒரு சிறிய மொழி மாதிரியை நிலையான தர இலக்குக்குப் பயிற்றுவிப்பதற்கான மிகச் சிறந்த வழியை ஆராய்ச்சியாளர்கள் தேடும் போட்டியாகும். இந்தக் கதை ஹேக்கர் நியூஸின் முதல் பக்கத்தில் விரைவாக ஏறியது, அங்கு உண்மையான அறிவியல் கண்டுபிடிப்புக்கான AI இன் திறன் பற்றி முடிவுகள் என்ன கூறுகின்றன என்பதைப் பற்றி விவாதிக்கும் டஜன் கணக்கான கருத்துகளை அது ஈர்த்தது. For more context on this story, see our ongoing breaking AI news.
NanoGPT ஸ்பீட்ரன் உண்மையில் என்ன
கெல்லர் ஜோர்டானால் பராமரிக்கப்படும் modded-nanogpt களஞ்சியம் மற்றும் சமூக பங்களிப்பாளர்களின் நீண்ட பட்டியலிலிருந்து இந்த அளவுகோல் வருகிறது. சவாலை ஏமாற்றுவது எளிது: 8 NVIDIA H100 GPUகளைப் பயன்படுத்தி, FineWeb சரிபார்ப்பு தொகுப்பில் 3.28 குறுக்கு-என்ட்ரோபி இழப்பை அடையும் மொழி மாதிரியைப் பயிற்றுவிக்கவும் - செயல்திறன் நிலை Andrej Karpathy இன் அசல் GPT-2 பிரதி 45 நிமிடங்களுக்குப் பிறகு - முடிந்தவரை வேகமாக.
கடந்த இரண்டு ஆண்டுகளில் நூற்றுக்கணக்கான சமூக பங்களிப்புகள் மூலம், மனித சாதனை 75 வினாடிகளுக்கு கீழ் மற்றும் 400 மில்லியனுக்கும் குறைவான பயிற்சி டோக்கன்களுக்கு குறைக்கப்பட்டுள்ளது, இது அசல் செய்முறையை விட 30 மடங்கு அதிகமாகும். வெற்றிகரமான தீர்வுகள் நவீன ML பொறியியலின் பட்டியலாகப் படிக்கப்படுகின்றன: Muon ஆப்டிமைசர், QK-Norm உடன் ரோட்டரி உட்பொதிப்புகள், ReLU-ஸ்கொயர்டு ஆக்டிவேஷன்கள், கவனம் மற்றும் MLP பாஸ்களில் FP8 குவாண்டேசேஷன், ஸ்லைடிங்-ஜன்னல் பேட்டர்ன்களுடன் கூடிய ஃப்ளாஷ் அட்டென்ஷன் 3 மற்றும் ஒன்றின் மேல் ஒன்றாக அடுக்கப்பட்ட டஜன் கணக்கான நுட்பங்கள்.
பிரைம் இன்டெலெக்டின் சோதனையானது பெஞ்ச்மார்க்கின் ஆப்டிமைசர் டிராக்கைப் பயன்படுத்தியது, இது - களஞ்சியத்தின் ஆவணங்களின்படி - ஒரு நிலையான கட்டமைப்பு, தரவுத்தொகுப்பு மற்றும் தொகுதி அளவு ஆகியவற்றிற்கு உட்பட்டு இலக்கு இழப்பைத் தாக்க தேவையான பயிற்சி படிகளின் எண்ணிக்கையை குறைக்கிறது. இது மூல வன்பொருள் வேகத்தைக் காட்டிலும் அல்காரிதம் கண்டுபிடிப்பின் ஒரு தூய சோதனையாக அமைகிறது.
பரிசோதனை எப்படி வேலை செய்தது
18 மாடல்களில் ஒவ்வொன்றும் தன்னிச்சையாக பணி கொடுக்கப்பட்டது: பயிற்சி செய்முறையில் மாற்றங்களை முன்மொழிதல், சோதனைகளை இயக்குதல், முடிவுகளை ஆய்வு செய்தல் மற்றும் மீண்டும் மீண்டும் - ஒரு நிலையான சரிபார்ப்பு ஸ்கிரிப்ட் மற்றும் நிலையான சீரற்ற விதைகள் மூலம் கூறப்பட்ட முன்னேற்றம் அதிர்ஷ்டமான ஓட்டத்திற்கு பதிலாக உண்மையானது என்பதை உறுதிப்படுத்துகிறது. ஒரு ஹேக்கர் நியூஸ் வர்ணனையாளர் சுருக்கமாக, மாதிரிகள் ஒரு சிறிய மாடலின் பயிற்சியை எவ்வாறு மேம்படுத்துவது, மீண்டும் மீண்டும் மாற்றங்களை முயற்சிப்பது, அவற்றைச் சோதிப்பது மற்றும் முடிவுகளைப் பயன்படுத்தி அடுத்து என்ன முயற்சி செய்ய வேண்டும் என்பதைத் தீர்மானிப்பது எப்படி என்று ஆராய்ச்சி செய்யும்படி கேட்கப்பட்டது.
கிளாட்-கோட், ஓபன்ஏஐயின் கோடெக்ஸ், கிமி-கோட், க்ரோக்-கிளை, க்வென்-கோட் மற்றும் ப்ரைம் இன்டலெக்டின் சொந்த பிரைம்-ஏஜெண்ட் உள்ளிட்ட பல்வேறு ஏஜென்ட் ஹார்னெஸ்கள் மூலம் மாடல்கள் வேலை செய்தன. மொத்தத்தில், சோதனையானது ஒரு சிறந்த மாடலுக்கு நூற்றுக்கணக்கான மில்லியன் டோக்கன்களையும் முழு கட்டம் முழுவதும் பில்லியன்களையும் பயன்படுத்தியது.
லீடர்போர்டு: கட்டுக்கதை 5 பேக்கை வழிநடத்துகிறது
தலைப்பு முடிவு: ஃபேபிள் 5 என அடையாளம் காணப்பட்ட மாடல், கிளாட்-கோட் சேணம் வழியாக இயங்குகிறது, அடிப்படை செய்முறைக்கும் மனித பதிவுக்கும் இடையிலான 81.7 சதவீத இடைவெளியை மூடியது, லீடர்போர்டின் மெட்ரிக்கில் 2,726 என்ற சிறந்த சரிபார்க்கப்பட்ட முடிவுடன். அங்கு செல்வதற்கு 8.7 நாட்கள் ஒட்டுமொத்த முகவர் நேரம், தோராயமாக 800 மில்லியன் டோக்கன்கள், 811 சோதனைகள் மற்றும் சுமார் 3,000 டூல் கால்கள் தேவைப்பட்டன.
சேஸிங் பேக் ஓபஸ் 5 ஆல் வழிநடத்தப்பட்டது, இது 53.6 சதவீத இடைவெளியை மூடியது, அதைத் தொடர்ந்து கிமி கே3 52.2 சதவீதமாக பிரைம் இன்டெலெக்டின் பிரைம்-ஏஜென்ட் ஹார்னஸால் இயக்கப்பட்டது (மற்றும் கிமி-கோட் வழியாக 45.8 சதவீதம்). ஓபஸ் 4.8 39.4 சதவீதத்தை நிர்வகித்தது, பல GPT-5.6 வகைகள் தோராயமாக 11 மற்றும் 36 சதவீதத்திற்கு இடையில் இறங்கியது, சொனட் 5 26.8 சதவீதத்தை மூடியது, மற்றும் க்ரோக் 4.5 மற்றும் க்வென்3.8 மேக்ஸ் ஒவ்வொன்றும் சுமார் 24.6 சதவீதத்தை எட்டியது.
மேலும் கீழே, DeepSeek V4 Pro 12.3 சதவீத இடைவெளியை மூடியது, GPT-5.5 8.1 சதவீதத்தை எட்டியது, மேலும் பழைய Kimi K2.7 7.2 சதவீதத்தில் முடிந்தது. குறிப்பிடத்தக்க வகையில், சமீபத்தில் வெளியிடப்பட்ட ஒரு மாடல் - GLM 5.3 - இன்னும் சரிபார்க்கப்பட்ட பதிவு இல்லாமல் வெளியீட்டு நேரத்தில் இயங்குகிறது, இது அவர்களின் சொந்த மேம்பாடுகளை நம்பத்தகுந்த முறையில் சரிபார்க்க முடியாத மாதிரிகளைத் தண்டிக்கும் என்பதை நினைவூட்டுகிறது.
ஏன் இது முக்கியமானது
குறியீட்டு லீடர்போர்டுகளை அளவிட முடியாது என்பதால், இந்த விஷயத்தை அளவுகோல்கள் விரும்புகின்றன: ஒரு உண்மையான ஆராய்ச்சி வளையத்தை இயக்கும் திறன் - கருதுகோள், பரிசோதனை, பகுப்பாய்வு, திருத்தம் - நிமிடங்களுக்குப் பதிலாக நாட்களில். அந்த திறன் தன்னாட்சி AI ஆராய்ச்சியின் வளர்ந்து வரும் துறையின் அடித்தளமாகும், இதில் முகவர்கள் ஸ்பெக்கிற்கு குறியீட்டை எழுதுவது அல்ல, ஆனால் யாரும் காட்டாத விஷயங்களைக் கண்டுபிடிப்பதில் பணிபுரிகின்றனர்.
முடிவுகளின் பரவல் தானே தகவல். சோதனையில் கிட்டத்தட்ட ஒவ்வொரு மாதிரியும் ஒரே மாதிரியான வெற்றிகரமான யோசனைகளைக் கண்டறிந்தன, திட்டத்தின் கட்டுரையின் படி - சிறந்த ரன்களை வேறுபடுத்தியது ஒரு சோதனை விட்டுச் சென்றது: வலுவான முகவர்கள் அவற்றைச் சரிபார்க்கும் அளவுக்கு பலவீனமான சமிக்ஞைகளை சத்தமில்லாத முடிவுகளில் பாதுகாத்து, தங்கள் சொந்த சோதனைத் தரவை நன்றாகப் புரிந்துகொண்டனர்.
சமூகத்திலிருந்து எச்சரிக்கைகள்
ஹேக்கர் நியூஸ் வர்ணனையாளர்கள் நியாயமான முறையான புள்ளிகளை எழுப்பினர். மாடல்களில் முயற்சி அமைப்புகளும் சேணம்களும் வேறுபடுகின்றன - கட்டுக்கதை 5 உயர் பகுத்தறிவு அமைப்பில் இயங்கியது, ஓபஸ் 5 அதிகபட்சமாக இயங்கியது - மேலும் 18 மாடல்களில் 153 ரன்கள் என்ற எண்கணிதம் சில மாதிரிகள் மற்றவர்களை விட அதிக முயற்சிகளைப் பெற்றதைக் குறிக்கிறது. ஒரு மாதிரியின் தரவரிசை அதன் மூல ஆராய்ச்சி திறனை பிரதிபலிக்கிறதா அல்லது அதன் சேனலின் தரம் ஒரு திறந்த கேள்வியாகவே உள்ளது.
இன்னும், பயணத்தின் திசை தெளிவாக உள்ளது. தற்போதைய சாதனையை அடைய வேகமான மனித கைகள் பல வருட கூட்டு முயற்சியை எடுத்தபோது, சிறந்த தன்னாட்சி முகவர்கள் இப்போது கணக்கீட்டு நேரத்தின் ஒரு வாரத்தில் அந்த இடைவெளியை மூடுகிறார்கள். அடுத்த கேள்வி - எந்த மாதிரியும் மீதமுள்ள 18.3 சதவீதத்தை மூட முடியுமா - எதிர்பார்த்ததை விட விரைவில் பதிலளிக்கப்படலாம்.
AI இன் எல்லையை வடிவமைக்கும் வரையறைகள் மற்றும் ஆராய்ச்சி பற்றி மேலும் அறிய, AI Buzz Wire இன் தொடர்ச்சியான கவரேஜைப் பின்பற்றவும்.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →