ஒவ்வொரு கட்டளையையும் மதிப்பாய்வு செய்யும் ஒரு மனிதன் AI குறியீட்டு முகவர்களைக் கட்டுக்குள் வைத்திருக்க முடியும் என்ற பிரபலமான அனுமானம் தீவிர ஆய்வுக்கு உட்பட்டுள்ளது. 40,000 க்கும் மேற்பட்ட விளையாட்டு அமர்வுகள் மற்றும் 409,000 க்கும் மேற்பட்ட தனிப்பட்ட ஒப்புதல் அல்லது மறுப்பு முடிவுகள் பற்றிய ஒரு புதிய பகுப்பாய்வு, மனித மதிப்பாய்வாளர்கள் AI முகவர்களிடமிருந்து மூன்று தீங்கிழைக்கும் கட்டளைகளில் ஒன்றைத் தவறவிட்டதாகக் கண்டறிந்தது, "மனிதன்-இன்-தி-லூப்" என்பது நம்பகமான பாதுகாப்பு எல்லையா என்பது குறித்த அவசரக் கேள்விகளை எழுப்புகிறது.

ஸ்கேல் X இல் டெவலப்பர் பாதுகாப்பு பற்றி எழுதும் உபெரின் முன்னாள் பணியாளர் பொறியாளர் அலெக்ஸ் வாட்டர்ஸ் உருவாக்கிய உலாவி அடிப்படையிலான கேமில் இருந்து கண்டுபிடிப்புகள் வந்துள்ளன. இந்த கேம் AI குறியீட்டு முகவருக்கு மனித மதிப்பாய்வாளர் பாத்திரத்தில் வீரர்களை வைக்கிறது. `git status` அல்லது `npm test` போன்ற சில கட்டளைகள் வழக்கமானவை. மற்றவை கவனமாக மாறுவேடமிட்டு நற்சான்றிதழ்களை வெளியேற்றும் முயற்சிகள், கதவுகளை நிறுவுதல் அல்லது தொலை சேவையகங்களுக்கு ரகசியங்களை அனுப்புதல். புள்ளியியல் கண்காணிப்பைச் சேர்த்த பிறகு, மனிதத் தீர்ப்பு எங்கு வெற்றிபெறுகிறது மற்றும் பெரும்பாலும் தோல்வியடைகிறது என்பதைப் பற்றிய விரிவான படத்தை வரைவதற்கு போதுமான தரவுகளை Wauters சேகரித்தார். பரந்த [AI தொழிற்துறை கவரேஜ்] (https://aibuzzwire.news) பற்றிய மேலும் தகவலுக்கு, இந்த ஆய்வு இன்றுவரை தரவுகள் நிறைந்த சோதனைகளில் ஒன்றாக உள்ளது.

மிகவும் ஆபத்தான கட்டளைகளை பிடிக்க கடினமாக இருந்தது

முக்கியமான கோப்பகங்களில் `rm -rf` போன்ற அழிவுகரமான கட்டளைகள் நம்பகத்தன்மையுடன் பிடிக்கப்பட்டன என்பது ஆய்வின் மிகவும் குறிப்பிடத்தக்க கண்டுபிடிப்பு. நற்சான்றிதழ்களைத் திருடுவதில் உண்மையில் வெற்றி பெற்ற அச்சுறுத்தல்கள் கிட்டத்தட்ட மூன்று முறை தவறவிடப்பட்டன. முழு கேமிலும் அதிகம் தவறவிடப்பட்ட கட்டளை `npm ரன் பகுப்பாய்வு` ஆகும், இது 64.7 சதவீத வீரர்களால் அங்கீகரிக்கப்பட்டது, இருப்பினும் ஏஜென்ட்டின் வரலாற்றுப் பதிவு வெளிப்புறச் சர்வருக்கு பைப் நற்சான்றிதழ்களை மாற்றியமைக்கப்பட்டது என்பதை தெளிவாகக் காட்டுகிறது.

பிரச்சனை கட்டமைப்பு ரீதியானது. திட்டத்தின் `package.json` கோப்பில் எந்த ஸ்கிரிப்ட் வரையறுக்கப்பட்டாலும் `npm run` போன்ற கட்டளைகள் செயல்படுத்தும். அந்த ஸ்கிரிப்ட் முறையான பண்டில் பகுப்பாய்வியாக இருக்கலாம் அல்லது ஏஜென்ட் திருத்திய முந்தைய கோப்பால் செலுத்தப்பட்ட தீங்கிழைக்கும் குறியீடாக இருக்கலாம். நிச்சயமாகத் தெரிந்துகொள்ள, டெவலப்பர் ஒவ்வொரு மாற்றியமைக்கப்பட்ட கோப்பையும் அங்கீகரிக்க வேண்டும், இது AI குறியீட்டு கருவிகள் வழங்க வேண்டிய வேக நன்மையை மறுக்கிறது.

விளையாட்டில் இதுபோன்ற மூன்று மாறுவேட-பேலோட் கட்டளைகள் முழுவதும், மற்ற அனைத்து நற்சான்றிதழ்-வெளியேற்றுதல் தாக்குதல்களுக்கும் 28.4 சதவீதத்துடன் ஒப்பிடும்போது மிஸ் விகிதம் 52.5 சதவீதமாக இருந்தது. பரிச்சயமான ஸ்கிரிப்ட் பெயருக்குப் பின்னால் பேலோடை மறைப்பது அதன் வெற்றி விகிதத்தை ஏறக்குறைய இரட்டிப்பாக்கியது, அனுமதி வரியில் காட்டப்படும் வரலாற்றுப் பதிவில் பேலோட் தெரிந்தாலும் கூட.

அனுமதி களைப்பு காலப்போக்கில் விழிப்புணர்வை அரிக்கிறது

அனுமதி சோர்வு என்பது அதன் கிளாட் கோட் தயாரிப்பில் ஒரு உண்மையான நிகழ்வு என்பதை ஆந்த்ரோபிக் முன்பு ஒப்புக்கொண்டது, ஒரு பயனர் எவ்வளவு ஒப்புதல்களைப் பார்க்கிறார்களோ, அவ்வளவு குறைவான கவனத்தை அவர்கள் ஒவ்வொருவருக்கும் செலுத்துகிறார்கள். ஸ்கேல் X தரவு இந்த கவலையை அனுபவபூர்வமாக ஆதரிக்கிறது. ஒவ்வொரு அமர்வின் முதல் சில கட்டளைகளின் போது மிஸ் விகிதங்கள் குறைந்து, ஆட்டக்காரர்கள் வார்ம் அப் ஆனார்கள், ஆனால் பின்னர் களைப்பு அல்லது டிக்டிங் கடிகாரத்தின் பெருகிவரும் அழுத்தத்திற்கு இசைவாக, முடிவில் சீராக ஏறினர்.

இந்த முறை நிஜ உலக இயக்கவியலை பிரதிபலிக்கிறது. டெவலப்பர்கள் டெட்லைன் அழுத்தத்தின் கீழ் அம்சங்களைக் கப்பலுக்கு அனுப்பும் பந்தயத்தை விரைவாகக் கிளிக் செய்வதற்கு அதே ஊக்கத்தை எதிர்கொள்கின்றனர், மேலும் வழக்கமான கட்டளைகளின் சுத்த அளவு ஒரு ஊசி-இன்-ஹேஸ்டாக் சிக்கலை உருவாக்குகிறது, அங்கு உண்மையான அச்சுறுத்தல்கள் புள்ளிவிவர ரீதியாக அரிதானவை. இதன் விளைவாக, பயனர்கள் அனைத்தையும் ரப்பர் ஸ்டாம்ப் செய்ய பயிற்சியளிக்கும் ஒரு அமைப்பு உள்ளது.

மறுபக்கம்: ஓவர்-பிளாக் செய்வது எல்லாவற்றையும் குறைக்கிறது

ஆய்வு எதிர் தோல்வி முறையையும் ஆவணப்படுத்தியது. நிலையான உருவாக்கம் மற்றும் சோதனை அழைப்புகள் உட்பட பல உண்மையான தீங்கற்ற கட்டளைகள் எச்சரிக்கையான வீரர்களால் வழக்கமாகத் தடுக்கப்பட்டன. இந்த அதிகப்படியான தடுப்பு முகவரைக் குறைக்கிறது மற்றும் முரண்பாடாக, நீண்ட கால ஆபத்தை அதிகரிக்கிறது. பாதிப்பில்லாத கட்டளைகளை அங்கீகரிக்குமாறு பயனர்கள் திரும்பத் திரும்பக் கேட்கப்படும்போது, ​​எதிர்காலத் தூண்டுதல்களை ஆராய்வதற்கான அவர்களின் விருப்பத்தை இரைச்சல் அரிக்கிறது, இறுதியில் அவர்களை முழுமையான பைபாஸ்கள் அல்லது மனித மதிப்பாய்வை முழுவதுமாக அகற்றும் தானியங்கு-அங்கீகரிப்பு முறைகளை நோக்கித் தள்ளுகிறது.

Anthropic's Auto Mode போன்ற அம்சங்கள், பயனரைத் தூண்டுவதற்கு முன், கட்டளை பாதுகாப்பானதா என்பதைத் தானாகவே தீர்மானிப்பதன் மூலம் இதைத் தணிக்க முயற்சிக்கிறது. ஆனால் மாறுவேடமிட்ட பேலோடுகள் பற்றிய ஆய்வின் தரவு நிரூபிக்கிறபடி, அழுத்தத்தின் கீழ் மனிதர்கள் நம்பகமான தீர்ப்புகளை வழங்க, புலப்படும் கட்டளை உள்ளடக்கங்கள் கூட போதுமானதாக இல்லை.

சூழல் தவறுவது முக்கிய பிரச்சனை

ஒரு கட்டளை, `cat ~/.zshrc`, 45.9 சதவீத வீரர்களால் அங்கீகரிக்கப்பட்ட முழு விளையாட்டிலும் மிகவும் பிளவுபட்டது. தங்கள் ஷெல் சுயவிவரத்தில் எந்த ரகசியத்தையும் வைத்திருக்காத டெவலப்பர்களுக்கு இந்த கட்டளை பாதிப்பில்லாதது, ஆனால் நற்சான்றிதழ்களை ஏற்றுமதி செய்யும் பலருக்கு இது API விசைகளை வெளிப்படுத்துகிறது. அதன் ஆபத்து முகவரால் பார்க்க முடியாத மற்றும் மதிப்பாய்வாளர் நினைவில் இல்லாத கணினி உள்ளமைவைப் பொறுத்தது.

இதே காரணத்திற்காக ஹேக்கர் நியூஸ் விவாதத் தொடரில் வேறு பல கட்டளைகளும் இதே போன்ற சர்ச்சையை உருவாக்கியது. அடிப்படைப் பிரச்சினை என்னவென்றால், டெவலப்பர்கள் என்ன கோப்புகள் மாறிவிட்டன, முகவர் முந்தைய படிகளில் என்ன செய்தார், மற்றும் கணினியின் தற்போதைய உள்ளமைவில் என்ன இருக்கிறது என்ற முழுப் படம் இல்லாமல் பாதுகாப்புத் தீர்ப்புகளை வழங்குமாறு கேட்கப்படுகிறது. ஒரு வர்ணனையாளர் குறிப்பிட்டது போல், சூழல் இல்லாமல் தெளிவற்ற கட்டளைகளை சரிபார்க்க பயனர்களைக் கேட்பது ஒரு வலுவான பாதுகாப்பு அல்ல.

முகவர் பாதுகாப்பிற்கு அடுத்து என்ன வருகிறது

வாட்டர்ஸ் தீர்வு சிறந்த மனிதர்கள் அல்ல ஆனால் சிறந்த கருவி என்று வாதிடுகிறார். சாண்ட்பாக்சிங் ஏஜெண்டுகள், நற்சான்றிதழ்களை நேரடியாக அணுக முடியாது, கடுமையான சூழல் தனிமைப்படுத்தல் மற்றும் உயர் அனுமதிகள் இல்லாமல் முகவர்கள் என்ன செய்ய முடியும் என்பதற்கான கட்டமைப்பு வரம்புகள் அனைத்தும் மனித விழிப்புணர்வை நம்புவதை விட மிகவும் நம்பிக்கைக்குரியவை. அந்த பாதுகாப்புகள் நடைமுறையில் இருக்கும் வரை, ஒரு நபர் பெயரளவில் வளையத்தில் இருந்தாலும், முகவர்களுக்கு பரந்த அனுமதிகளை வழங்குவது ஆபத்தானதாகவே இருக்கும்.

இந்த ஆய்வு ஒரு சக மதிப்பாய்வு செய்யப்பட்ட கல்வித் தாள் அல்ல, வாட்டர்ஸ் அதன் வரம்புகளை ஒப்புக்கொள்கிறார். கேம் வீரர்களுக்கு அச்சுறுத்தல்கள் குறித்து எச்சரித்தது மற்றும் உண்மையான வளர்ச்சி சூழல்களை முழுமையாக பிரதிபலிக்காத செயற்கை நேர அழுத்தத்தை பயன்படுத்தியது. ஆனால் அழுத்தத்தின் கீழ் பயிற்சி பெற்ற மனித மதிப்பாய்வாளர்கள் வேண்டுமென்றே மாறுவேடமிட்ட தாக்குதல்களில் மூன்றில் ஒரு பங்கைத் தவறவிடுகிறார்கள் என்ற முக்கிய கண்டுபிடிப்பு, AI குறியீட்டு முகவர்களை வரிசைப்படுத்தும் ஒவ்வொரு குழுவும் தங்கள் பாதுகாப்பு மாதிரியை மறுபரிசீலனை செய்வதற்கான காரணத்தை வழங்க வேண்டும்.

இன்று AI முகவர்களைக் கொண்டு உருவாக்கும் டெவலப்பர்களுக்கு, ஹ்யூமன்-இன்-தி-லூப் இறுதியில் தோல்வியடையும் என்று கருதுவதே நடைமுறைச் செயல்பாடாகும். உங்கள் ஏஜென்ட் அனுமதிகள் மற்றும் சாண்ட்பாக்ஸிங்கை வடிவமைக்கவும், தவறவிட்ட ஒப்புதல் கசிந்த AWS விசை அல்லது சமரசம் செய்யப்பட்ட பைப்லைனைக் குறிக்காது. மனித மதிப்பாய்வை உங்கள் முதன்மைப் பாதுகாப்பாகக் கருதுவது பலனளிக்காத ஒரு பந்தயம் என்று தரவு தெரிவிக்கிறது.

AIக்கு முன்னால் இருங்கள்

AI முகவர் பாதுகாப்பு நிலப்பரப்பு வேகமாக உருவாகி வருகிறது. சமீபத்திய AI மேம்பாடுகள் மற்றும் பிரேக்கிங் ஆராய்ச்சியுடன் தொடர்ந்து தெரிந்துகொள்ளுங்கள்.

மேலும் AI செய்திகளைப் படிக்கவும் →