பெரிய மொழி மாதிரிகள் (எல்எல்எம்கள்) தரவுகளிலிருந்து வழிமுறைகளை எவ்வாறு பிரிக்கின்றன என்பதில் ஒரு அடிப்படை குருட்டுப் புள்ளியைப் பயன்படுத்தும் பகுத்தறிவு AI மாதிரிகளுக்கு எதிராக ஒரு சக்திவாய்ந்த புதிய தாக்குதலை ஆராய்ச்சியாளர்கள் நிரூபித்துள்ளனர். Chain-of-Thought (CoT) Forgery என்று அழைக்கப்படும் நுட்பம், ஒரு மாதிரியைத் தாக்குபவர்-வழங்கப்பட்ட உரையை மாதிரியின் சொந்த உள் பகுத்தறிவு போல கையாள்வதில் ஏமாற்றுகிறது, இது உரையை முறையான வழிமுறைகளை மீற அனுமதிக்கிறது.
ஹேக்கடே அறிக்கை செய்த கண்டுபிடிப்புகள், கையாளுதலுக்கு எதிராக AI அமைப்புகளைப் பாதுகாப்பது ஏன் தீர்க்கப்படாத பிரச்சனையாக உள்ளது என்பதை அடிக்கோடிட்டுக் காட்டுகிறது. துறையில் வளர்ந்து வரும் அச்சுறுத்தல்களைத் தொடர, எங்கள் AI இன்டண்டஸ்ட் கவரேஜை தொடர்ந்து பகுப்பாய்வு செய்யவும்.
மூல காரணம்: பங்கு குழப்பம்
பாதிப்பின் இதயத்தில் ஆராய்ச்சியாளர்கள் "பங்கு குழப்பம்" என்று விவரிக்கிறார்கள். நவீன எல்எல்எம்கள் அவற்றின் உள்ளீடு-கணினி விதிகள், பயனர் கோரிக்கைகள் மற்றும் மாதிரியின் சொந்த சிந்தனைப் பகுத்தறிவு அனைத்தையும் ஒரே உரைச் சேனல் மூலம் பெறுகின்றன. ஒழுங்கை விதிக்க, டெவலப்பர்கள் நம்பிக்கையின் படிநிலையை உருவாக்க `
`
தாக்குதல் எவ்வாறு செயல்படுகிறது
முக்கியமாக, CoT Forgery என்பது, பெரும்பாலான மாடல்கள் நிராகரிக்கும் `
ஹேக்கடேயின் கூற்றுப்படி, இது LLM ஆனது வெளிப்படையான நியாயமற்ற காரணத்தை முன்கூட்டிய முடிவாக ஏற்றுக்கொள்கிறது, ஒரு பயனரின் கோரிக்கைக்கு அதன் பதிலை மாற்றுகிறது. ஏமாற்றப்பட்ட உள்ளடக்கமானது குறைந்த நம்பிக்கையான பயனர் உள்ளீட்டைக் காட்டிலும் அதிக நம்பிக்கை கொண்ட உள் சிந்தனையாகக் கருதப்படுவதால், இது பொதுவாக கையாளும் வழிமுறைகளைத் தடுக்கும் பாதுகாப்புக் கம்பிகளைத் தவிர்த்துவிடும்.
ஒரு LLM இன் உள்ளே நம்பிக்கையின் படிநிலை
தாக்குதல் ஏன் வெற்றி பெறுகிறது என்பதைப் புரிந்து கொள்ள, பாத்திரங்கள் எவ்வாறு செயல்படுகின்றன என்பதைப் புரிந்து கொள்ள வேண்டும். ஹூட்டின் கீழ், பாத்திரங்கள் மாதிரியின் உள்ளீட்டை ஒழுங்கமைக்கப்பட்ட படிநிலையில் பிரிக்கின்றன. ஒரு பாத்திரத்தில் உள்ள வழிமுறைகள் அதிக முன்னுரிமையுடன் முரண்படாத வரை பின்பற்றப்படும். உதாரணமாக, "சட்டவிரோத நடவடிக்கைகளைப் பற்றி விவாதிக்க வேண்டாம்" என்ற அமைப்பு-நிலை உத்தரவு, தடைசெய்யப்பட்ட செய்முறையை வழங்குவதற்கான பயனர் கோரிக்கையை மீறுவதாகும். `
மாதிரியானது அந்த படிநிலையை இயந்திரத்தனமாக செயல்படுத்தாததால் முறிவு ஏற்படுகிறது. அதற்கு பதிலாக, எந்த உரை எந்த பாத்திரத்திற்கு சொந்தமானது என்பதை இது ஓரளவு ஸ்டைலிஸ்டிக் குறிப்புகளிலிருந்து ஊகிக்கிறது. ஆராய்ச்சியின் சமூக விவாதம் குறிப்பிட்டது போல, ஒரு சிந்தனைச் சூழலைப் போல உரை வடிவமைக்கப்பட்டிருந்தால், மாதிரியானது உண்மையான பகுத்தறிவுக்கு ஒத்த கட்டமைப்பைக் கொண்ட எந்தவொரு உரையையும் தவறாகப் புரிந்து கொள்ளலாம் - மேலும் சிந்தனை உரையானது சாதாரண பயனர் உரையை விட அதிக முன்னுரிமையைக் கொண்டுள்ளது.
ஒரு புதிய திருப்பத்துடன் ஒரு பழக்கமான முறை
AI அமைப்புகளில் நீண்டகாலமாக அங்கீகரிக்கப்பட்ட பலவீனத்தை ஆராய்ச்சி உருவாக்குகிறது: உடனடி ஊசி. எல்.எல்.எம்.களுக்கு அறிவுறுத்தல்கள் மற்றும் தரவுகளுக்கு தனித்தனி ஸ்ட்ரீம்கள் இல்லை என்பதை ஆரம்பகால தாக்குதல்கள் பயன்படுத்திக் கொண்டன, எனவே "முந்தைய அனைத்து வழிமுறைகளையும் புறக்கணிக்கவும்" போன்ற ஒரு சொற்றொடர் சில நேரங்களில் ஒரு மாதிரியின் நடத்தையை கடத்தலாம். பாத்திரங்கள் மற்றும் மெட்டாடேட்டா குறிச்சொற்களின் அறிமுகம் நம்பிக்கை படிநிலையை உருவாக்குவதன் மூலம் இதைக் குறைக்கும்.
CoT Forgery தணிப்பு முழுமையடையவில்லை என்பதை நிரூபிக்கிறது. மாதிரிகள் உரையின் நம்பகத்தன்மையை அதன் கட்டமைப்பு மெட்டாடேட்டாவைக் காட்டிலும் ஓரளவு அதன் ஸ்டைலிஸ்டிக் குணாதிசயங்களால் தீர்மானிக்கும் வரை, சரியான பாணியைப் பிரதிபலிக்கும் தாக்குபவர்கள் தங்கள் உள்ளீட்டின் உணரப்பட்ட அதிகாரத்தை அதிகரிக்க முடியும்.
ஏன் சரி செய்வது கடினம்
ஆராய்ச்சியாளர்கள், சார்லஸ் யே, ஜாஸ்மின் குய் மற்றும் டிலான் ஹாட்ஃபீல்ட்-மென்ல், எல்எல்எம்களில் பங்கு உணர்தல் ஒரு பைனரி சொத்து அல்ல, அது சுத்தமாக செயல்படுத்தப்பட முடியாது என்று வாதிடுகின்றனர். மாதிரிகள் கடின-குறியிடப்பட்ட விதிகள் மூலம் குறிச்சொற்களை விளக்குவதற்குப் பதிலாக பயிற்சியின் மூலம் கற்றுக்கொள்கின்றன, அதாவது அவற்றின் நடத்தை தரவுகளில் உள்ள வடிவங்களால் வடிவமைக்கப்பட்டுள்ளது - மேலும் வடிவங்களைப் பின்பற்றலாம்.
ஹேக்கடேயால் சிறப்பிக்கப்படும் வேலை பற்றிய சமூக விவாதம், மீண்டும் மீண்டும் வரும் கருப்பொருளை வெளிப்படுத்தியது: தூய்மையான பிழைத்திருத்தத்திற்கு, கற்றறிந்த, பாணி அடிப்படையிலான குறிப்புகளை நம்பாமல், கட்டமைப்பு ரீதியாக தனித்தனியான பாதைகள் மூலம் நம்பகமான உள்ளீடுகளைக் கையாள மாதிரிகள் தேவைப்படும். அது நிகழும் வரை, உடனடி ஊசி-பாணி தாக்குதல்களுக்கு எதிராகப் பாதுகாப்பது ஒரு தீர்க்கப்பட்ட சிக்கலைக் காட்டிலும் வளரும் செயல்முறையாகவே இருக்கும்.
பரந்த தாக்கங்கள்
ஆய்வக ஆர்ப்பாட்டங்களுக்கு அப்பாற்பட்ட பாதிப்பு முக்கியமானது. இணையத்தில் உலாவவும், குறியீட்டை இயக்கவும் மற்றும் பயனரின் சார்பாக நடவடிக்கை எடுக்கவும் கூடிய முகவர் அமைப்புகளில் பகுத்தறிவு மாதிரிகள் அதிகளவில் பயன்படுத்தப்படுகின்றன. தாக்குபவர் ஒரு மாதிரியின் உள் முடிவுகளை உருவாக்கினால், அவர்கள் அந்தச் செயல்களை திட்டமிடப்படாத அல்லது தீங்கு விளைவிக்கும் விளைவுகளை நோக்கிச் செல்ல முடியும். மாதிரிகள் அதிக சுயாட்சி மற்றும் கருவிகளுக்கான அணுகலைப் பெறுவதால் ஆபத்து அதிகரிக்கிறது. மனிதர்கள் புத்திசாலித்தனமாகவும் ஆக்கப்பூர்வமாகவும் இருப்பார்கள் என்றும், நம்பகமான மற்றும் நம்பத்தகாத உரைக்கு இடையே சுத்தமான கட்டடக்கலைப் பிரிப்பு இல்லாத வரை, உறுதியான தாக்குபவர்கள் கோட்டை மங்கலாக்குவதற்கான வழிகளைக் கண்டுபிடிப்பார்கள் என்று ஆராய்ச்சியாளர்கள் குறிப்பிடுகின்றனர். காகிதமானது சவாலை ஒரு பிழையாகக் குறைவாகவும், கடினமான-குறியிடப்பட்ட விதிகளிலிருந்து தரவுகளிலிருந்து தங்கள் நடத்தையைக் கற்றுக் கொள்ளும் அமைப்புகளின் கட்டமைப்புப் பண்புகளாகவும் உருவாக்குகிறது.
முழுமையான தாள் arXiv இல் கிடைக்கிறது, மேலும் ஆராய்ச்சியாளர்கள் GitHub இல் குறியீட்டு எடுத்துக்காட்டுகளை வெளியிட்டுள்ளனர், இதனால் டெவலப்பர்கள் தங்கள் சொந்த அமைப்புகள் பாதிக்கப்படுமா என்பதை சோதிக்க முடியும்.
AIக்கு முன்னால் இருங்கள்
AI பாதுகாப்பு ஆராய்ச்சி, பாதுகாப்பு பாதிப்புகள் மற்றும் பெரிய மொழி மாதிரிகளின் எல்லை பற்றி மேலும் அறிய, AI Buzz Wire ஐப் பார்வையிடவும்.
மேலும் AI செய்திகளைப் படிக்கவும் →


