சகானா AI ஆனது, "Beyond Imitation" என்ற ஆய்வுக் கட்டுரையை, இயந்திர கற்றல் ஆராய்ச்சியின் (TMLR) இதழில், எல்.எல்.எம்-உதவியுடன் கூடிய சக மதிப்பாய்வு முறையை விவரிக்கிறது, இது மனித மதிப்புரைகளைப் பின்பற்றுவதை விட பிழை கண்டறிதலை மையமாகக் கொண்டது, MarkTechPost அக்டோபர் 10 அன்று அறிக்கை செய்தது. மனித மதிப்புரைகளுடன் பொருந்துகிறது, அது விதைக்கப்பட்ட தவறைக் கண்டுபிடிக்க முடியுமா?
குழு இரண்டு கலைப்பொருட்களை அனுப்பியது: பிழை கண்டறிதலை அளவிடுவதற்கான ஒரு முரண்பாடான அளவுகோல் மற்றும் ஒவ்வொரு அடிப்படை சோதனைக்கும் வழிவகுத்த பல அடுக்கு மதிப்பாய்வு (MLR) அமைப்பு. சக மதிப்பாய்வை மேம்படுத்த AI ஐப் பயன்படுத்துவதில் ஆர்வம் அதிகரித்து வரும் நிலையில் முடிவுகள் வந்துள்ளன - இது சமர்ப்பிப்பு தொகுதிகள் அதிகரிப்பதில் இருந்து சிரமத்திற்கு உட்பட்டுள்ளது. AI ஆராய்ச்சியை எவ்வாறு மறுவடிவமைக்கிறது என்பதைப் பற்றி மேலும் அறிய, எங்கள் சமீபத்திய AI மேம்பாடுகளைப் பின்பற்றவும்.
விதைக்கப்பட்ட தவறுகளின் அளவுகோல்
முரண்பாடான பெஞ்ச்மார்க் பிழைகளை உண்மையான ஆவணங்களில் இடுகிறது மற்றும் மதிப்பாய்வாளர்கள் அவற்றைப் பிடிக்கிறார்களா என்பதைச் சரிபார்க்கிறது. ஆராய்ச்சியாளர்கள் ACL, AISTATS, CVPR மற்றும் ICML 2025 மற்றும் NeurIPS 2024 ஆகியவற்றிலிருந்து 257 CC- உரிமம் பெற்ற ஆவணங்களைச் சேகரித்தனர், பின்னர் ஒவ்வொரு தாளின் கூற்றுகள், சான்றுகள் மற்றும் முறைகளின் அறிவு வரைபடத்தை உருவாக்க Gemini 2.5 Pro ஐப் பயன்படுத்தினர்.
தீவிரத்தன்மை கட்டமைப்பு ரீதியாக வரையறுக்கப்படுகிறது: காகிதத்தின் "முக்கிய உரிமைகோரலில்" இருந்து ஒரு முனையின் தூரம் பிழை எவ்வளவு மையமானது என்பதை தீர்மானிக்கிறது. தொலைவு பூஜ்ஜியம் ஒரு முக்கிய உரிமைகோரலைத் தாக்குகிறது; பெரிய தூரங்கள் துணை விவரங்களைத் தாக்கும். GPT-4.1 ஆனது ஒரு தூரத்திற்கு ஒரு முனையை ஒரு முரண்பாடாக மாற்றி எழுதுகிறது, மொத்தத்தில் 1,164 தரவு புள்ளிகளை உருவாக்குகிறது. ஒரு o3 நீதிபதி ஒவ்வொரு மதிப்பாய்விற்கும் பத்து முறை மதிப்பெண்கள் தருகிறார். சுத்தமான ஆவணங்களில் நீதிபதி 99.9% துல்லியத்தை அடைந்தார், மேலும் இது கைமுறையாக உறுதிப்படுத்தப்பட்ட கேட்சுகளில் 86.8% உணர்திறனைக் காட்டியது - அதாவது அறிக்கையிடப்பட்ட கண்டறிதல் மதிப்பெண்கள் உண்மையில் பழமைவாதமாக இருக்கலாம்.
பல அடுக்கு மதிப்பாய்வு எவ்வாறு செயல்படுகிறது
MLR என்பது ஒரு காகிதத்தை விமர்சிக்கும் முன் புரிந்து கொள்ளும் ஒரு ஏஜென்டிக் அமைப்பாகும், இது ஆஃப்-தி-ஷெல்ஃப் க்ளாட் மாடல்களில் இயங்கும் மூன்று சிறப்பு முகவர்களிடமிருந்து கூடியது - GPU கிளஸ்டர் இல்லை மற்றும் ஃபைன்-ட்யூனிங் தேவையில்லை:
- இணைப்பு முகவர் (கிளாட் ஹைக்கூ 3.5): பின்னிணைப்பில் இருந்து பரிசோதனைகள் மற்றும் செயல்படுத்தல் விவரங்களைச் சுருக்கமாகக் கூறுகிறது.
- இலக்கிய மதிப்பாய்வு முகவர் (கிளாட் சோனட் 4, விருப்பத்திற்குரியது): முந்தைய வேலையின் சூழலில் காகிதத்தை வைக்க வலைத் தேடலைப் பயன்படுத்துகிறது.
- விமர்சன முகவர் (Claude Sonnet 4): கணினி விஞ்ஞானி எஸ். கேசவின் நன்கு அறியப்பட்ட "த்ரீ-பாஸ் அப்ரோச்" மூலம் ஈர்க்கப்பட்ட த்ரீ-பாஸ் ப்ராம்ட் செயினை இயக்குகிறது — முதலில் ஒரு உயர்நிலை அவுட்லைன், பின்னர் ஒரு விரிவான வாசிப்பு, பலவீனங்கள், அனுமானங்கள் மற்றும் இடைவெளிகளைக் கொடியிடுதல், மற்றும் இறுதியாக அனைத்து கேள்விகளும், பலம், பலவீனம், பலம், பலவீனம் ஆகியவற்றைப் பரிந்துரைக்கவும். ஒரு மதிப்பெண், மற்றும் செய்ய வேண்டிய பட்டியல்.
PDF நேரடியாக மாதிரிகளுக்கு அனுப்பப்படுகிறது, எனவே புள்ளிவிவரங்கள் மற்றும் சமன்பாடுகள் செயலாக்கத்தில் உயிர்வாழும். சிஸ்டம் பிரதான உரையின் 10 பக்கங்கள் வரை படிக்கிறது, மேலும் ஒரு மதிப்பாய்விற்கு $0.47 செலவாகும் என சகானா மதிப்பிடுகிறது.
முடிவுகள்: வடிவமைப்பு மற்றும் மாதிரி தேர்வு இரண்டும் முக்கியம்
MLR நான்கு அமைப்புகளையும் பெஞ்ச்மார்க்கில் சோதனை செய்தது. நான்கு சுயாதீன மதிப்புரைகளுடன், இது 73.43% முக்கிய உரிமைகோரல் (தொலைவு-பூஜ்ஜியம்) முரண்பாடுகளையும் ஒட்டுமொத்தமாக 40.95% ஐயும் பிடித்தது. சிறந்த பேஸ்லைன், ஏஜென்ட் ரிவியூ எனப்படும் அமைப்பு, முக்கிய உரிமைகோரல்களில் 14.81% மட்டுமே நிர்வகிக்கிறது. ஒரு MLR மதிப்பாய்வு கூட 60.79% முக்கிய உரிமைகோரல் பிழைகளைப் பிடித்தது.
ஒரு நீக்குதல் ஆய்வு மாதிரியின் தேர்விலிருந்து வடிவமைப்பின் பங்களிப்பை பிரிக்கிறது. ஏற்கனவே உள்ள மறுஆய்வு பைப்லைனுக்குள் க்ளாட் சோனட் 4 க்கு GPT-4.1 இடமாற்றம் செய்வது கோர்-க்ளைம் கண்டறிதலை 14.56% இலிருந்து 35.40% ஆக உயர்த்தியது, அதே சமயம் MLR இன் மல்டி-ஏஜென்ட் டிசைன் ஒரு மதிப்பாய்விற்கு மேல் சுமார் 25 சதவீத புள்ளிகளைச் சேர்த்தது. முக்கிய உரிமைகோரலில் இருந்து பிழைகள் விலகிச் செல்லும்போது கண்டறிதல் துல்லியம் குறைகிறது, இது தீவிர மதிப்பெண்ணை ஆதரிக்கிறது என்று ஆசிரியர்கள் கூறுகிறார்கள்.
குழப்பமான, நிஜ உலகத் தரவுகளில் படம் இருட்டடைகிறது. WithdrarXiv-Check இல், 211 உண்மையில் பின்வாங்கப்பட்ட arXiv ஆவணங்களின் தொகுப்பில், MLR "ஒத்த" போட்டிகளில் 26.07% மற்றும் சரியான பொருத்தங்களில் 16.11% மதிப்பெண்களைப் பெற்றது - மேலும் கையெழுத்துப் பிரதியில் விதைக்கப்பட்ட மறைக்கப்பட்ட உடனடி ஊசி மூலம் கணினி பாதிக்கப்படக்கூடியதாகவே உள்ளது. உண்மையான பின்வாங்கப்பட்ட ஆவணங்களைப் படிப்பது, வேறுவிதமாகக் கூறினால், செயற்கை முரண்பாடுகளைப் பிடிப்பதை விட மிகவும் கடினமானது.
சக மதிப்பாய்வுக்கு என்ன அர்த்தம்
ஆய்வின் மிகவும் நடைமுறையான எடுத்துக்காட்டானது குறைவான கவர்ச்சியானதாக இருக்கலாம்: கணினி வடிவமைப்பு மற்றும் மாதிரித் தேர்வு இரண்டும் பிழை கண்டறிதலை உள்ளடக்கமாக நகர்த்துகின்றன, மேலும் மதிப்பாய்வு செய்வதற்கு முன் படிக்கும் விமர்சகர்கள் மனித மதிப்பாய்வு உரையில் உள்ள மாதிரி-பொருத்தத்தை விட மிகவும் தீவிரமான பிழைகளைக் கண்டறிந்துள்ளனர். அந்த வேறுபாடு முக்கியமானது, ஏனெனில் AI-உதவி மதிப்பாய்வின் பெரும்பாலான முந்தைய வேலைகள் மனித தீர்ப்புகளுடன் உடன்படுவதற்கு உகந்ததாக இருந்தது - உண்மையான ஆய்வுக்கு பதிலாக நம்பிக்கையுடன் கூடிய இணக்கத்திற்கு வெகுமதி அளிக்கும் மெட்ரிக்.
மனித நடுவர்களை மாற்ற AI தயாராக இருப்பதாக சகானாவின் முடிவுகள் தெரிவிக்கவில்லை - உண்மையான பின்வாங்கப்பட்ட தாள்களில் பெரும்பாலான பிழைகளைத் தவறவிடும் மற்றும் உட்பொதிக்கப்பட்ட தூண்டுதல்களால் கையாளக்கூடிய ஒரு அமைப்பு, ஒரு உதவி அடுக்காகக் கருதப்படுகிறது, ஒரு அதிகாரமாக அல்ல. பெஞ்ச்மார்க்கின் செயற்கைப் பிழைகள், புள்ளியியல் தெளிவின்மைகள் மற்றும் போட்டியிட்ட விளக்கங்களை விடவும் தூய்மையானவை, அவை சக மதிப்பாய்வில் உண்மையான கருத்து வேறுபாடுகளில் ஆதிக்கம் செலுத்துகின்றன, எனவே விதைக்கப்பட்ட முரண்பாடுகளில் செயல்திறன் உச்சவரம்பாகப் படிக்கப்பட வேண்டும், வாக்குறுதியாக அல்ல.
ஆனால் ஒரு மதிப்பாய்விற்கு தோராயமாக $0.47, சோதனை செய்யப்பட்ட எந்த அமைப்பிலும் மிக அதிகமான பிழை-கண்டறிதல் வீதத்துடன், MLR, AI மதிப்பாய்வாளர்கள் முரண்பாடுகளுக்கான முதல்-பாஸ் திரையைக் கையாளும் போது, மனித மதிப்பாய்வாளர்கள் இன்னும் இயந்திரங்கள் செய்ய முடியாத தீர்ப்பின் மீது கவனம் செலுத்தும் ஒரு நெருங்கிய காலத்தை நோக்கிச் செல்கிறது. எல்.எல்.எம்-உதவி மதிப்பாய்வைப் பரிசோதிக்கும் பத்திரிகைகள் மற்றும் மாநாட்டு அமைப்பாளர்கள் இப்போது தங்கள் சொந்த அமைப்புகளுக்கு எதிராக ஒரு பொது அளவுகோல் மற்றும் வலுவான அடிப்படை ஆகியவற்றைக் கொண்டுள்ளனர் - மேலும், 73.43% மற்றும் 14.81% இடையே இடைவெளி இருந்தால், கட்டிடக்கலை மூல மாதிரி அளவை விட முக்கியமானது என்பதற்கான தெளிவான சமிக்ஞை.
---
AIக்கு முன்னால் இருங்கள்சமீபத்திய AI செய்திகள், பகுப்பாய்வு மற்றும் முன்னேற்றங்கள் - அனைத்தையும் ஒரே இடத்தில் பெறுங்கள்.
மேலும் AI செய்திகளைப் படிக்கவும் →