பெரிய மொழி மாதிரிகள் (எல்எல்எம்கள்) தரவுகளிலிருந்து வழிமுறைகளை எவ்வாறு பிரிக்கின்றன என்பதில் ஒரு அடிப்படை குருட்டுப் புள்ளியைப் பயன்படுத்தும் பகுத்தறிவு AI மாதிரிகளுக்கு எதிராக ஒரு சக்திவாய்ந்த புதிய தாக்குதலை ஆராய்ச்சியாளர்கள் நிரூபித்துள்ளனர். Chain-of-Thought (CoT) Forgery என்று அழைக்கப்படும் நுட்பம், ஒரு மாதிரியைத் தாக்குபவர்-வழங்கப்பட்ட உரையை மாதிரியின் சொந்த உள் பகுத்தறிவு போல கையாள்வதில் ஏமாற்றுகிறது, இது உரையை முறையான வழிமுறைகளை மீற அனுமதிக்கிறது.

ஹேக்கடே அறிக்கை செய்த கண்டுபிடிப்புகள், கையாளுதலுக்கு எதிராக AI அமைப்புகளைப் பாதுகாப்பது ஏன் தீர்க்கப்படாத பிரச்சனையாக உள்ளது என்பதை அடிக்கோடிட்டுக் காட்டுகிறது. துறையில் வளர்ந்து வரும் அச்சுறுத்தல்களைத் தொடர, எங்கள் AI இன்டண்டஸ்ட் கவரேஜை தொடர்ந்து பகுப்பாய்வு செய்யவும்.

மூல காரணம்: பங்கு குழப்பம்

பாதிப்பின் இதயத்தில் ஆராய்ச்சியாளர்கள் "பங்கு குழப்பம்" என்று விவரிக்கிறார்கள். நவீன எல்எல்எம்கள் அவற்றின் உள்ளீடு-கணினி விதிகள், பயனர் கோரிக்கைகள் மற்றும் மாதிரியின் சொந்த சிந்தனைப் பகுத்தறிவு அனைத்தையும் ஒரே உரைச் சேனல் மூலம் பெறுகின்றன. ஒழுங்கை விதிக்க, டெவலப்பர்கள் நம்பிக்கையின் படிநிலையை உருவாக்க ``, `` மற்றும் `` போன்ற மெட்டாடேட்டா குறிச்சொற்களைப் பயன்படுத்துகின்றனர். தீங்கு விளைவிக்கும் உள்ளடக்கத்தைத் தவிர்ப்பதற்கான `` உத்தரவு, எடுத்துக்காட்டாக, மாறாக `` கோரிக்கையை மீற வேண்டும்.

`` குறிச்சொல் மிகவும் சக்தி வாய்ந்தது, ஏனெனில் இது மாதிரியின் உள் பகுத்தறிவு செயல்முறையைப் பிரதிநிதித்துவப்படுத்துகிறது, இது அதிக நம்பிக்கையைக் கொண்டுள்ளது. ஆராய்ச்சியாளர்கள் கண்டறிந்த சிக்கல் என்னவென்றால், மாதிரிகள் எதை நம்புவது என்பதைத் தீர்மானிக்க குறிச்சொற்களை முதன்மையாக நம்புவதில்லை. எழுத்து நடைக்கு முன்னுரிமை கொடுக்கிறார்கள். ஒரு மாதிரியின் உள் `<சிந்தனை>` வெளியீட்டை ஒத்ததாக ஸ்டைலிஸ்டிக்காக வடிவமைக்கப்பட்ட உரை, அது உண்மையில் எங்கிருந்து வந்தது என்பதைப் பொருட்படுத்தாமல், உண்மையான பகுத்தறிவு என்று தவறாகப் புரிந்து கொள்ளலாம்.

தாக்குதல் எவ்வாறு செயல்படுகிறது

முக்கியமாக, CoT Forgery என்பது, பெரும்பாலான மாடல்கள் நிராகரிக்கும் `` குறிச்சொற்களுக்குள் தீங்கிழைக்கும் ப்ராம்ப்ட்டைச் சுற்றி வைப்பது அல்ல. அதற்குப் பதிலாக, தாக்குபவர், மாதிரியின் சொந்த தனித்துவமான உள் பகுத்தறிவுக் குரலுடன் நெருக்கமாகப் பொருந்தக்கூடிய ஒரு பாணியில் சுருண்ட பகுத்தறிவை எழுதுகிறார். மாதிரி இந்த உரையை எதிர்கொள்ளும் போது, ​​அது ஏமாற்றப்பட்ட பகுத்தறிவை ஏற்கனவே அடைந்த முடிவாகக் கருதுகிறது.

ஹேக்கடேயின் கூற்றுப்படி, இது LLM ஆனது வெளிப்படையான நியாயமற்ற காரணத்தை முன்கூட்டிய முடிவாக ஏற்றுக்கொள்கிறது, ஒரு பயனரின் கோரிக்கைக்கு அதன் பதிலை மாற்றுகிறது. ஏமாற்றப்பட்ட உள்ளடக்கமானது குறைந்த நம்பிக்கையான பயனர் உள்ளீட்டைக் காட்டிலும் அதிக நம்பிக்கை கொண்ட உள் சிந்தனையாகக் கருதப்படுவதால், இது பொதுவாக கையாளும் வழிமுறைகளைத் தடுக்கும் பாதுகாப்புக் கம்பிகளைத் தவிர்த்துவிடும்.

ஒரு LLM இன் உள்ளே நம்பிக்கையின் படிநிலை

தாக்குதல் ஏன் வெற்றி பெறுகிறது என்பதைப் புரிந்து கொள்ள, பாத்திரங்கள் எவ்வாறு செயல்படுகின்றன என்பதைப் புரிந்து கொள்ள வேண்டும். ஹூட்டின் கீழ், பாத்திரங்கள் மாதிரியின் உள்ளீட்டை ஒழுங்கமைக்கப்பட்ட படிநிலையில் பிரிக்கின்றன. ஒரு பாத்திரத்தில் உள்ள வழிமுறைகள் அதிக முன்னுரிமையுடன் முரண்படாத வரை பின்பற்றப்படும். உதாரணமாக, "சட்டவிரோத நடவடிக்கைகளைப் பற்றி விவாதிக்க வேண்டாம்" என்ற அமைப்பு-நிலை உத்தரவு, தடைசெய்யப்பட்ட செய்முறையை வழங்குவதற்கான பயனர் கோரிக்கையை மீறுவதாகும். `` பாத்திரம் அந்த படிநிலையின் உச்சியில் அமர்ந்திருக்கிறது, ஏனெனில் அது ஏற்கனவே தானே அடைந்துவிட்டதாக மாதிரி நம்பும் முடிவுகளை இது பிரதிபலிக்கிறது.

மாதிரியானது அந்த படிநிலையை இயந்திரத்தனமாக செயல்படுத்தாததால் முறிவு ஏற்படுகிறது. அதற்கு பதிலாக, எந்த உரை எந்த பாத்திரத்திற்கு சொந்தமானது என்பதை இது ஓரளவு ஸ்டைலிஸ்டிக் குறிப்புகளிலிருந்து ஊகிக்கிறது. ஆராய்ச்சியின் சமூக விவாதம் குறிப்பிட்டது போல, ஒரு சிந்தனைச் சூழலைப் போல உரை வடிவமைக்கப்பட்டிருந்தால், மாதிரியானது உண்மையான பகுத்தறிவுக்கு ஒத்த கட்டமைப்பைக் கொண்ட எந்தவொரு உரையையும் தவறாகப் புரிந்து கொள்ளலாம் - மேலும் சிந்தனை உரையானது சாதாரண பயனர் உரையை விட அதிக முன்னுரிமையைக் கொண்டுள்ளது.

ஒரு புதிய திருப்பத்துடன் ஒரு பழக்கமான முறை

AI அமைப்புகளில் நீண்டகாலமாக அங்கீகரிக்கப்பட்ட பலவீனத்தை ஆராய்ச்சி உருவாக்குகிறது: உடனடி ஊசி. எல்.எல்.எம்.களுக்கு அறிவுறுத்தல்கள் மற்றும் தரவுகளுக்கு தனித்தனி ஸ்ட்ரீம்கள் இல்லை என்பதை ஆரம்பகால தாக்குதல்கள் பயன்படுத்திக் கொண்டன, எனவே "முந்தைய அனைத்து வழிமுறைகளையும் புறக்கணிக்கவும்" போன்ற ஒரு சொற்றொடர் சில நேரங்களில் ஒரு மாதிரியின் நடத்தையை கடத்தலாம். பாத்திரங்கள் மற்றும் மெட்டாடேட்டா குறிச்சொற்களின் அறிமுகம் நம்பிக்கை படிநிலையை உருவாக்குவதன் மூலம் இதைக் குறைக்கும்.

CoT Forgery தணிப்பு முழுமையடையவில்லை என்பதை நிரூபிக்கிறது. மாதிரிகள் உரையின் நம்பகத்தன்மையை அதன் கட்டமைப்பு மெட்டாடேட்டாவைக் காட்டிலும் ஓரளவு அதன் ஸ்டைலிஸ்டிக் குணாதிசயங்களால் தீர்மானிக்கும் வரை, சரியான பாணியைப் பிரதிபலிக்கும் தாக்குபவர்கள் தங்கள் உள்ளீட்டின் உணரப்பட்ட அதிகாரத்தை அதிகரிக்க முடியும்.

ஏன் சரி செய்வது கடினம்

ஆராய்ச்சியாளர்கள், சார்லஸ் யே, ஜாஸ்மின் குய் மற்றும் டிலான் ஹாட்ஃபீல்ட்-மென்ல், எல்எல்எம்களில் பங்கு உணர்தல் ஒரு பைனரி சொத்து அல்ல, அது சுத்தமாக செயல்படுத்தப்பட முடியாது என்று வாதிடுகின்றனர். மாதிரிகள் கடின-குறியிடப்பட்ட விதிகள் மூலம் குறிச்சொற்களை விளக்குவதற்குப் பதிலாக பயிற்சியின் மூலம் கற்றுக்கொள்கின்றன, அதாவது அவற்றின் நடத்தை தரவுகளில் உள்ள வடிவங்களால் வடிவமைக்கப்பட்டுள்ளது - மேலும் வடிவங்களைப் பின்பற்றலாம்.

ஹேக்கடேயால் சிறப்பிக்கப்படும் வேலை பற்றிய சமூக விவாதம், மீண்டும் மீண்டும் வரும் கருப்பொருளை வெளிப்படுத்தியது: தூய்மையான பிழைத்திருத்தத்திற்கு, கற்றறிந்த, பாணி அடிப்படையிலான குறிப்புகளை நம்பாமல், கட்டமைப்பு ரீதியாக தனித்தனியான பாதைகள் மூலம் நம்பகமான உள்ளீடுகளைக் கையாள மாதிரிகள் தேவைப்படும். அது நிகழும் வரை, உடனடி ஊசி-பாணி தாக்குதல்களுக்கு எதிராகப் பாதுகாப்பது ஒரு தீர்க்கப்பட்ட சிக்கலைக் காட்டிலும் வளரும் செயல்முறையாகவே இருக்கும்.

பரந்த தாக்கங்கள்

ஆய்வக ஆர்ப்பாட்டங்களுக்கு அப்பாற்பட்ட பாதிப்பு முக்கியமானது. இணையத்தில் உலாவவும், குறியீட்டை இயக்கவும் மற்றும் பயனரின் சார்பாக நடவடிக்கை எடுக்கவும் கூடிய முகவர் அமைப்புகளில் பகுத்தறிவு மாதிரிகள் அதிகளவில் பயன்படுத்தப்படுகின்றன. தாக்குபவர் ஒரு மாதிரியின் உள் முடிவுகளை உருவாக்கினால், அவர்கள் அந்தச் செயல்களை திட்டமிடப்படாத அல்லது தீங்கு விளைவிக்கும் விளைவுகளை நோக்கிச் செல்ல முடியும். மாதிரிகள் அதிக சுயாட்சி மற்றும் கருவிகளுக்கான அணுகலைப் பெறுவதால் ஆபத்து அதிகரிக்கிறது. மனிதர்கள் புத்திசாலித்தனமாகவும் ஆக்கப்பூர்வமாகவும் இருப்பார்கள் என்றும், நம்பகமான மற்றும் நம்பத்தகாத உரைக்கு இடையே சுத்தமான கட்டடக்கலைப் பிரிப்பு இல்லாத வரை, உறுதியான தாக்குபவர்கள் கோட்டை மங்கலாக்குவதற்கான வழிகளைக் கண்டுபிடிப்பார்கள் என்று ஆராய்ச்சியாளர்கள் குறிப்பிடுகின்றனர். காகிதமானது சவாலை ஒரு பிழையாகக் குறைவாகவும், கடினமான-குறியிடப்பட்ட விதிகளிலிருந்து தரவுகளிலிருந்து தங்கள் நடத்தையைக் கற்றுக் கொள்ளும் அமைப்புகளின் கட்டமைப்புப் பண்புகளாகவும் உருவாக்குகிறது.

முழுமையான தாள் arXiv இல் கிடைக்கிறது, மேலும் ஆராய்ச்சியாளர்கள் GitHub இல் குறியீட்டு எடுத்துக்காட்டுகளை வெளியிட்டுள்ளனர், இதனால் டெவலப்பர்கள் தங்கள் சொந்த அமைப்புகள் பாதிக்கப்படுமா என்பதை சோதிக்க முடியும்.

AIக்கு முன்னால் இருங்கள்

AI பாதுகாப்பு ஆராய்ச்சி, பாதுகாப்பு பாதிப்புகள் மற்றும் பெரிய மொழி மாதிரிகளின் எல்லை பற்றி மேலும் அறிய, AI Buzz Wire ஐப் பார்வையிடவும்.

மேலும் AI செய்திகளைப் படிக்கவும் →