மெட்டாவில் உள்ள FAIR, ஆக்ஸ்போர்டு பல்கலைக்கழகம் மற்றும் லண்டன் பல்கலைக்கழக கல்லூரி ஆகியவற்றின் ஆராய்ச்சிக் குழு AI ஆராய்ச்சி முன்னுரிமை மாதிரிகளை (RPMs) அறிமுகப்படுத்தியுள்ளது, இது ஒரு தன்னாட்சி ஆராய்ச்சி முகவர் உண்மையில் எந்த இயந்திர கற்றல் சோதனைகளை இயக்க வேண்டும் என்பதை தீர்மானிக்கும் ஒரு முறையாகும். ஒரு சோதனை எப்படி மதிப்பெண் பெறும் என்பதைக் கணிக்காமல், ஒரு RPM செயல்படுத்தப்படாத வேட்பாளர்களை வரிசைப்படுத்துகிறது மற்றும் மிகவும் நம்பிக்கைக்குரிய ஒன்றைத் தேர்ந்தெடுக்கிறது, AI- உந்துதல் ஆராய்ச்சியில் உண்மையான தடையை நிவர்த்தி செய்கிறது என்று குழு கூறுகிறது: சரிபார்ப்பு கணக்கீடு, வேலை பற்றிய MarkTechPost இன் அறிக்கையின்படி.

ஆராய்ச்சி முகவர்கள் ஏற்கனவே தங்கள் சொந்த சோதனைகளை முன்மொழியலாம், செயல்படுத்தலாம் மற்றும் மதிப்பெண் பெறலாம் என்ற தருணத்தில் யோசனை இறங்குகிறது. யோசனை உருவாக்கம் மலிவானது; மரணதண்டனை அல்ல. ஒரு தனி வேட்பாளருக்குப் பயிற்சி அளிப்பது பல மணிநேரங்கள் முதல் பல நாட்கள் வரை GPU நேரத்தைச் செலவழிக்கக்கூடும், எனவே ஒரு முகவர் தவிர்க்க முடியாமல் தன்னால் இயங்கக்கூடியதை விட அதிகமான சோதனைகளை முன்மொழிகிறார். எந்த வேட்பாளர்கள் செயல்படுத்தப்படுவார்கள் என்பது, குழு அதை வடிவமைக்கும்போது, ​​ஆராய்ச்சி முன்னேற்றத்தின் உண்மையான நெம்புகோல். தங்கள் கம்ப்யூட் பில்கள் ஏறுவதைப் பார்க்கும் ஆய்வகங்களுக்கு, அந்த ஃப்ரேமிங்தான் ஆராய்ச்சி ஆட்டோமேஷனில் சமீபத்திய AI மேம்பாடுகள் முழுவதும் கவனத்தை ஈர்க்கிறது.

பரிசோதனை தேர்வு ஏன் தடையாக உள்ளது

முழுமையான அளவீடுகள் அல்லது செயல்படுத்தல் விளைவுகளை முன்னறிவிப்பதில் மொழி மாதிரிகள் நம்பகத்தன்மையற்றவை என்று குழு கண்டறிந்தது. ஒரு மாதிரி ஒரு வேட்பாளர் பரிசோதனையைப் பார்த்து அது அடையும் மதிப்பெண்ணைத் துல்லியமாகக் கணிக்க முடியாது. இது என்ன செய்ய முடியும், ஆராய்ச்சியாளர்கள் கண்டறிந்தனர், இரண்டு வேட்பாளர்களில் யார் சிறந்த பந்தயம் என்பதை தீர்மானிக்கிறார்கள் - ஒரு முழுமையான கணிப்பைக் காட்டிலும் ஒப்பீட்டு ஒப்பீடு. RPMகள் அந்த வேறுபாட்டைச் சுற்றியே கட்டமைக்கப்பட்டுள்ளன: அவை ஒருபோதும் மதிப்பெண்ணைக் கணிப்பதில்லை, அவை மட்டுமே தரவரிசைப்படுத்துகின்றன.

இந்த அமைப்பு AIRA-dojo உள்ளே இயங்குகிறது, இது பேராசை கொண்ட பெற்றோர் தேர்வு மற்றும் வரைவு, மேம்படுத்துதல் மற்றும் பிழைத்திருத்த ஆபரேட்டர்கள் மூலம் இயந்திர கற்றல் சோதனைகளை உருவாக்கும் ஒரு திறந்த-மூல பரிணாம மர தேடல் சாரக்கட்டு, இறுதியில் அதிக சரிபார்ப்பு-மதிப்பீடு முனையை வழங்கும். பெஞ்ச்மார்க், AIRS-Bench என்பதும் திறந்த மூலமாகும். சாரக்கட்டு மற்றும் முன்னுரிமை மாதிரி இரண்டும் Qwen3.6-27B ஐ அவற்றின் முதுகெலும்பாகப் பயன்படுத்துகின்றன, இது திறந்த எடைகள் என்று குழு குறிப்பிடுகிறது.

நாக் அவுட் போட்டி எவ்வாறு செயல்படுகிறது

ஒரு குழந்தை பரிசோதனையை உருவாக்கி அதை செயல்படுத்துவதற்கு பதிலாக, 15 செயல்படுத்தப்படாத வேட்பாளர்களை உருவாக்குவதற்கு இணையாக 15 முறை ஒரு ஆபரேட்டரை ஏஜென்ட் பயன்படுத்துகிறார். நாக் அவுட் போட்டியில் RPM அவர்களை ஜோடியாக ஒப்பிடுகிறது, மேலும் வெற்றியாளர் மட்டுமே செயல்படுத்தப்படுவார். ஒவ்வொரு ஒப்பீடும், ஆய்வு செய்யப்பட்ட மரத்தின் அகல-முதல் நடை மூலம் சேகரிக்கப்பட்ட சூழல் முனைகளில் அடிப்படையாக உள்ளது, ஒவ்வொரு வேட்பாளரும் அதன் மூதாதையர்களின் சரிபார்ப்பு மதிப்பெண்களுடன் காட்டப்படுகிறார்கள், எனவே வெற்றிடத்தை விட ஏஜெண்டின் உண்மையான தேடல் வரலாற்றிலிருந்து நீதிபதி காரணங்களைத் தீர்மானிக்கிறார்.

வெவ்வேறு கணக்கீட்டு வரவுசெலவுத் திட்டங்களுடன் இரண்டு வகைகளை கட்டுரை விவரிக்கிறது:

  • அனுமானம்-மட்டும் RPM — ஒரு LLM-ஆக-ஒரு நீதிபதியாக வேட்பாளர் திட்டங்கள், குறியீடு மற்றும் தேடல் வரலாற்றை ஒரே பாஸில் ஒப்பிட்டுப் பார்க்கலாம். அதன் ப்ராம்ட் DSPy கட்டமைப்பிலிருந்து MIPROv2 உடன் உகந்ததாக்கப்பட்டது மற்றும் குழு முதன்மை-ஆய்வாளர் ரூப்ரிக் என்று அழைக்கிறது: இது சரிசெய்யக்கூடிய பிழைகளை பொறுத்துக்கொள்கிறது, விரிவாக்கத்தை வெகுமதி அளிக்கிறது மற்றும் தேவையற்ற ஆராய்ச்சி திசைகளுக்கு அபராதம் விதிக்கிறது. ஆஃப்லைன் ஒப்பீட்டு துல்லியம் 57.7 முதல் 59.0 சதவீதம் வரை அளவிடப்படுகிறது.
  • Agentic RPM — அதே நீதிபதி மற்றும் ஒரு சாண்ட்பாக்ஸ், ஏஜெண்டின் சூழலை குளோன் செய்கிறது, இதில் ஒற்றை H200 GPU உட்பட, பைதான், பாஷ் மற்றும் சமர்ப்பிப்பு-தீர்வு நடவடிக்கை ஆகியவற்றிற்கு மட்டுப்படுத்தப்பட்ட கருவிகள். இது சிறிய அளவிலான பைலட் சோதனைகளை இயக்குகிறது, பின்னர் ஒரு பின்னூட்ட மாதிரியானது மிகவும் தகவலறிந்த அடுத்த பரிசோதனையை முன்மொழிகிறது அல்லது சுழற்சியை முடிக்கிறது. விமானிகள் 60-வினாடி வாசலில் 30 ஆகக் குறைக்கப்படுகிறார்கள், மீதமுள்ள நேர வரவுசெலவுத் திட்டம் வேண்டுமென்றே மிகைப்படுத்தப்பட்டுள்ளது - உண்மையான 300 க்கு எதிராக 2,700 வினாடிகள் பதிவாகியுள்ளன - எனவே முகவர் முன்கூட்டியே மேம்படுத்துவதை நிறுத்தவில்லை.

ஒரு நீதிபதி ஒரு முதன்மை புலனாய்வாளர் போல டியூன் செய்தார்

முதன்மை-ஆய்வாளர் ஃப்ரேமிங் அமைதியாக சுவாரஸ்யமான பகுதியாகும். அதிகபட்சமாக ஈர்க்கக்கூடியதாக இருக்கும் வேட்பாளர்களுக்கு வெகுமதி அளிப்பதற்குப் பதிலாக, ஒரு அனுபவமிக்க ஆராய்ச்சியாளர் எவ்வாறு யோசனைகளைச் செயல்படுத்துகிறார் என்பதை மேம்படுத்தப்பட்ட ரூப்ரிக் பிரதிபலிக்கிறது: நிலையானதாக இருக்கும் தரமற்ற குறியீடு, ஒரு முட்டுச்சந்தைப் பின்தொடரும் மெருகூட்டப்பட்ட குறியீட்டை துடிக்கிறது மற்றும் ஏற்கனவே உள்ள மரத்தை நகலெடுக்கும் திசைகள் புதுமையானவற்றை விட குறைவாக இருக்கும். கை-டியூனிங்கைக் காட்டிலும் உடனடி தேர்வுமுறை மூலம் கற்றுக்கொண்ட அந்த ரூப்ரிக், முன்னேற்றத்தைக் கொண்டுள்ளது என்று அணியின் நீக்கங்கள் தெரிவிக்கின்றன.

AIRS-Bench இல் பெஞ்ச்மார்க் முடிவுகள்

மதிப்பீடு 20 பொது உரை மற்றும் அட்டவணைப் பணிகளை உள்ளடக்கியது, ஒவ்வொரு பணிக்கும் ஒரு H200 மற்றும் 10 சீரற்ற விதைகளில் 24 மணிநேரம் கொடுக்கப்பட்டது. முக்கியமாக, அதே Qwen3.6-27B முதுகெலும்பு சோதனை ஆபரேட்டர்கள் மற்றும் முன்னுரிமை மாதிரி இரண்டையும் இயக்குகிறது, எனவே ஆதாயங்கள் வலுவான நீதிபதி மாதிரியைக் காட்டிலும் தேர்வு அடுக்கில் இருந்து வருகின்றன. சராசரி இயல்பாக்கப்பட்ட மதிப்பெண்கள்:

  • RPM இல்லை (ரேண்டம் பிக்): 0.684
  • அனுமானம் மட்டும் RPM: 0.711
  • ஏஜென்டிக் ஆர்பிஎம்: 0.729
  • சரிபார்ப்பு ஆரக்கிள் (உச்சவரம்பு): 0.748
  • டெஸ்ட் ஆரக்கிள் (உச்சவரம்பு): 0.759

சீரற்ற தேர்வை விட முன்னேற்றத்தின் நிகழ்தகவு அனுமானம்-மட்டும் மாறுபாட்டிற்கு 0.5923 ஆகவும், ஏஜென்டிக் ஒன்றிற்கு 0.5913 ஆகவும் இருந்தது, 95 சதவீத நம்பிக்கை இடைவெளி குறைந்த வரம்புகளான 0.5066 மற்றும் 0.5018 - 0.5 வரம்புக்கு மேல் - புள்ளியியல் முக்கியத்துவத்தை விட அணி மாறக்கூடியது.

செயல்திறன் மிகவும் நடைமுறை முடிவு. அனுமானம்-மட்டும் RPM ஆனது 14.88 மணி நேரத்தில் 0.684 என்ற ரேண்டம் பேஸ்லைனின் இறுதி மதிப்பெண்ணை அடைந்தது, ஒரு 1.61x வேகம், அதே சமயம் ஏஜென்டிக் மாறுபாட்டிற்கு 15.50 மணிநேரம், 1.55x வேகம் தேவைப்பட்டது. சுய-ஹோஸ்ட் செய்யப்பட்ட நீதிபதி அனுமானத்தின் மேல்நிலையைக் கணக்கிட்டாலும், சரிசெய்யப்பட்ட எண்கள் சாதகமாகவே இருந்தன.

திறந்த எடைகள் மற்றும் நேர்மையான எச்சரிக்கைகள்

RPMகள் இன்று ஓரளவு மட்டுமே பயன்படுத்தப்படுகின்றன என்பதை குழு வெளிப்படையாகக் கூறுகிறது. உதிரிபாகங்கள் திறந்த நிலையில் உள்ளன - உறைந்த முன் பயிற்சி பெற்ற முதுகெலும்புகள், சிறந்த-டியூனிங், ஒரு திறந்த மூல சாரக்கட்டு மற்றும் அளவுகோல், மற்றும் திறந்த எடை கொண்ட முதுகெலும்பு மாதிரிகள் - ஆனால் ஏஜென்டிக் மாறுபாட்டின் சாண்ட்பாக்ஸ் தேவை மற்றும் அதன் பைலட்-பரிசோதனை மேல்நிலை ஆகியவை பெரும்பாலான ஆய்வகங்கள் அனுமானம்-மட்டும் பதிப்பில் தொடங்கும். பைலட் நேரம் முகவரின் சொந்த கடிகாரத்துடன் போட்டியிடுவதால், பிழைத்திருத்த படிகள் ஏஜென்டிக் மாறுபாட்டில் சீரற்ற தேர்வுக்கு மாற்றியமைக்கப்படுகின்றன என்பதையும் ஆராய்ச்சியாளர்கள் குறிப்பிடுகின்றனர்.

பெரிய முக்கியத்துவம் திசையாக இருக்கலாம். தன்னாட்சி ஆராய்ச்சி முகவர்கள் டெமோக்களில் இருந்து தினசரி பயன்பாட்டிற்கு தொழில்துறை ஆய்வகங்களில் செல்லும்போது, ​​பற்றாக்குறையான ஆதாரம் இனி யோசனைகள் அல்ல, ஆனால் GPU மணிநேரம் மற்றும் காலப்போக்கில் ஒரு நிலையான கணக்கீட்டு பட்ஜெட் கலவையிலிருந்து அதிக முன்னேற்றத்தை கசக்கும் முறைகள். ஓடுவதற்கு முன் தரவரிசைப்படுத்துவது ஒரு எளிய யோசனையாகும், மேலும் AIRS-பெஞ்ச் எண்கள் இது ஒரு முக்கியமான யோசனையாக இருக்கும் என்று பரிந்துரைக்கின்றன.

AIக்கு முன்னால் இருங்கள்

AI Buzz Wire இல் நாளைய மாடல்களை வடிவமைக்கும் ஆராய்ச்சியைத் தொடரவும். மேலும் AI செய்திகளைப் படிக்கவும் →