ਖੋਜਕਰਤਾਵਾਂ ਨੇ ਤਰਕਸ਼ੀਲ AI ਮਾਡਲਾਂ ਦੇ ਵਿਰੁੱਧ ਇੱਕ ਸ਼ਕਤੀਸ਼ਾਲੀ ਨਵੇਂ ਹਮਲੇ ਦਾ ਪ੍ਰਦਰਸ਼ਨ ਕੀਤਾ ਹੈ ਜੋ ਇੱਕ ਬੁਨਿਆਦੀ ਅੰਨ੍ਹੇ ਸਥਾਨ ਦਾ ਸ਼ੋਸ਼ਣ ਕਰਦਾ ਹੈ ਕਿ ਕਿਵੇਂ ਵੱਡੇ ਭਾਸ਼ਾ ਮਾਡਲ (LLMs) ਡੇਟਾ ਤੋਂ ਨਿਰਦੇਸ਼ਾਂ ਨੂੰ ਵੱਖ ਕਰਦੇ ਹਨ। ਤਕਨੀਕ, ਜਿਸਨੂੰ ਚੇਨ-ਆਫ-ਥੌਟ (CoT) ਜਾਅਲਸਾਜ਼ੀ ਕਿਹਾ ਜਾਂਦਾ ਹੈ, ਇੱਕ ਮਾਡਲ ਨੂੰ ਹਮਲਾਵਰ-ਸਪਲਾਈ ਕੀਤੇ ਟੈਕਸਟ ਨੂੰ ਇਸ ਤਰ੍ਹਾਂ ਸਮਝਦਾ ਹੈ ਜਿਵੇਂ ਕਿ ਇਹ ਮਾਡਲ ਦਾ ਆਪਣਾ ਨਿੱਜੀ ਅੰਦਰੂਨੀ ਤਰਕ ਹੋਵੇ, ਟੈਕਸਟ ਨੂੰ ਜਾਇਜ਼ ਨਿਰਦੇਸ਼ਾਂ ਨੂੰ ਓਵਰਰਾਈਡ ਕਰਨ ਦੀ ਆਗਿਆ ਦਿੰਦਾ ਹੈ।
ਹੈਕਡੇ ਦੁਆਰਾ ਰਿਪੋਰਟ ਕੀਤੀ ਗਈ ਖੋਜ, ਇਸ ਗੱਲ 'ਤੇ ਜ਼ੋਰ ਦਿੰਦੀ ਹੈ ਕਿ ਹੇਰਾਫੇਰੀ ਦੇ ਵਿਰੁੱਧ ਏਆਈ ਪ੍ਰਣਾਲੀਆਂ ਨੂੰ ਸੁਰੱਖਿਅਤ ਕਰਨਾ ਇੱਕ ਅਣਸੁਲਝੀ ਸਮੱਸਿਆ ਕਿਉਂ ਹੈ। ਖੇਤਰ ਵਿੱਚ ਉੱਭਰ ਰਹੇ ਖਤਰਿਆਂ ਨਾਲ ਜੁੜੇ ਰਹਿਣ ਲਈ, ਚੱਲ ਰਹੇ ਵਿਸ਼ਲੇਸ਼ਣ ਲਈ ਸਾਡੇ AI ਉਦਯੋਗ ਕਵਰੇਜ ਦੀ ਪਾਲਣਾ ਕਰੋ।
ਮੂਲ ਕਾਰਨ: ਭੂਮਿਕਾ ਉਲਝਣ
ਕਮਜ਼ੋਰੀ ਦੇ ਕੇਂਦਰ ਵਿੱਚ ਖੋਜਕਰਤਾਵਾਂ ਨੇ "ਭੂਮਿਕਾ ਉਲਝਣ" ਵਜੋਂ ਵਰਣਨ ਕੀਤਾ ਹੈ। ਆਧੁਨਿਕ LLM ਆਪਣੇ ਸਾਰੇ ਇੰਪੁੱਟ-ਸਿਸਟਮ ਨਿਯਮ, ਉਪਭੋਗਤਾ ਬੇਨਤੀਆਂ, ਅਤੇ ਮਾਡਲ ਦੀ ਆਪਣੀ ਚੇਨ-ਆਫ-ਥੌਟ ਤਰਕ-ਇੱਕ ਸਿੰਗਲ ਟੈਕਸਟ ਚੈਨਲ ਦੁਆਰਾ ਪ੍ਰਾਪਤ ਕਰਦੇ ਹਨ। ਆਰਡਰ ਲਗਾਉਣ ਲਈ, ਡਿਵੈਲਪਰ ਭਰੋਸੇ ਦੀ ਲੜੀ ਬਣਾਉਣ ਲਈ `
`
ਹਮਲਾ ਕਿਵੇਂ ਕੰਮ ਕਰਦਾ ਹੈ
ਮਹੱਤਵਪੂਰਨ ਤੌਰ 'ਤੇ, CoT ਜਾਅਲਸਾਜ਼ੀ ਸਿਰਫ਼ `
ਹੈਕਡੇਅ ਦੇ ਅਨੁਸਾਰ, ਇਹ LLM ਨੂੰ ਇੱਕ ਉਪਭੋਗਤਾ ਦੀ ਬੇਨਤੀ ਦੇ ਜਵਾਬ ਵਿੱਚ ਬਦਲਦੇ ਹੋਏ, ਇੱਕ ਅਗਾਊਂ ਸਿੱਟੇ ਵਜੋਂ ਪਾਰਦਰਸ਼ੀ ਤੌਰ 'ਤੇ ਤਰਕਹੀਣ ਤਰਕ ਨੂੰ ਸਵੀਕਾਰ ਕਰਨ ਦਾ ਕਾਰਨ ਬਣਦਾ ਹੈ। ਕਿਉਂਕਿ ਧੋਖਾਧੜੀ ਵਾਲੀ ਸਮੱਗਰੀ ਨੂੰ ਘੱਟ-ਭਰੋਸੇਯੋਗ ਉਪਭੋਗਤਾ ਇਨਪੁਟ ਦੀ ਬਜਾਏ ਉੱਚ-ਭਰੋਸੇ ਵਾਲੀ ਅੰਦਰੂਨੀ ਸੋਚ ਵਜੋਂ ਸਮਝਿਆ ਜਾਂਦਾ ਹੈ, ਇਹ ਸੁਰੱਖਿਆ ਗਾਰਡਰੇਲਾਂ ਨੂੰ ਬਾਈਪਾਸ ਕਰ ਸਕਦਾ ਹੈ ਜੋ ਆਮ ਤੌਰ 'ਤੇ ਹੇਰਾਫੇਰੀ ਨਿਰਦੇਸ਼ਾਂ ਨੂੰ ਰੋਕਦਾ ਹੈ।
ਇੱਕ LLM ਦੇ ਅੰਦਰ ਟਰੱਸਟ ਦੀ ਲੜੀ
ਇਹ ਸਮਝਣ ਲਈ ਕਿ ਹਮਲਾ ਕਿਉਂ ਸਫਲ ਹੁੰਦਾ ਹੈ ਇਹ ਸਮਝਣ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ ਕਿ ਭੂਮਿਕਾਵਾਂ ਕਿਵੇਂ ਕੰਮ ਕਰਦੀਆਂ ਹਨ। ਹੁੱਡ ਦੇ ਹੇਠਾਂ, ਰੋਲ ਮਾਡਲ ਦੇ ਇੰਪੁੱਟ ਨੂੰ ਇੱਕ ਸੰਗਠਿਤ ਲੜੀ ਵਿੱਚ ਵੰਡਦੇ ਹਨ। ਕਿਸੇ ਭੂਮਿਕਾ ਵਿੱਚ ਨਿਰਦੇਸ਼ਾਂ ਦਾ ਉਦੋਂ ਤੱਕ ਪਾਲਣ ਕੀਤਾ ਜਾਂਦਾ ਹੈ ਜਦੋਂ ਤੱਕ ਉਹ ਉੱਚ-ਪ੍ਰਾਥਮਿਕਤਾ ਵਾਲੇ ਲੋਕਾਂ ਨਾਲ ਟਕਰਾਅ ਨਹੀਂ ਕਰਦੇ। ਉਦਾਹਰਨ ਲਈ, "ਗੈਰ-ਕਾਨੂੰਨੀ ਗਤੀਵਿਧੀਆਂ 'ਤੇ ਚਰਚਾ ਨਾ ਕਰੋ" ਦਾ ਇੱਕ ਸਿਸਟਮ-ਪੱਧਰ ਦਾ ਨਿਰਦੇਸ਼, ਇੱਕ ਵਰਜਿਤ ਵਿਅੰਜਨ ਪ੍ਰਦਾਨ ਕਰਨ ਲਈ ਇੱਕ ਉਪਭੋਗਤਾ ਬੇਨਤੀ ਨੂੰ ਓਵਰਰਾਈਡ ਕਰਨਾ ਹੈ। `<ਸੋਚੋ>` ਭੂਮਿਕਾ ਉਸ ਲੜੀ ਦੇ ਸਿਖਰ ਦੇ ਨੇੜੇ ਬੈਠਦੀ ਹੈ ਕਿਉਂਕਿ ਇਹ ਉਹਨਾਂ ਸਿੱਟਿਆਂ ਨੂੰ ਦਰਸਾਉਂਦੀ ਹੈ ਜੋ ਮਾਡਲ ਦਾ ਮੰਨਣਾ ਹੈ ਕਿ ਇਹ ਪਹਿਲਾਂ ਹੀ ਆਪਣੇ ਆਪ 'ਤੇ ਪਹੁੰਚ ਚੁੱਕਾ ਹੈ।
ਬ੍ਰੇਕਡਾਊਨ ਵਾਪਰਦਾ ਹੈ ਕਿਉਂਕਿ ਮਾਡਲ ਮਸ਼ੀਨੀ ਤੌਰ 'ਤੇ ਉਸ ਲੜੀ ਨੂੰ ਲਾਗੂ ਨਹੀਂ ਕਰਦਾ ਹੈ। ਇਸ ਦੀ ਬਜਾਏ, ਇਹ ਅੰਦਾਜ਼ਾ ਲਗਾਉਂਦਾ ਹੈ ਕਿ ਸ਼ੈਲੀ ਦੇ ਸੰਕੇਤਾਂ ਤੋਂ ਅੰਸ਼ਕ ਤੌਰ 'ਤੇ ਕਿਹੜਾ ਟੈਕਸਟ ਕਿਸ ਭੂਮਿਕਾ ਨਾਲ ਸਬੰਧਤ ਹੈ। ਜਿਵੇਂ ਕਿ ਖੋਜ ਦੀ ਕਮਿਊਨਿਟੀ ਚਰਚਾ ਨੇ ਨੋਟ ਕੀਤਾ, ਜੇਕਰ ਟੈਕਸਟ ਨੂੰ ਸੋਚਣ ਵਾਲੇ ਸੰਦਰਭ ਵਾਂਗ ਪੈਟਰਨ ਕੀਤਾ ਗਿਆ ਹੈ, ਤਾਂ ਮਾਡਲ ਸਹੀ ਤਰਕ ਲਈ ਸਮਾਨ ਢਾਂਚੇ ਵਾਲੇ ਕਿਸੇ ਵੀ ਟੈਕਸਟ ਨੂੰ ਗਲਤ ਕਰ ਸਕਦਾ ਹੈ - ਅਤੇ ਸੋਚਣ ਵਾਲਾ ਟੈਕਸਟ ਆਮ ਉਪਭੋਗਤਾ ਟੈਕਸਟ ਨਾਲੋਂ ਉੱਚ ਤਰਜੀਹ ਰੱਖਦਾ ਹੈ।
ਇੱਕ ਨਵੇਂ ਮੋੜ ਦੇ ਨਾਲ ਇੱਕ ਜਾਣਿਆ-ਪਛਾਣਿਆ ਪੈਟਰਨ
ਖੋਜ ਏਆਈ ਪ੍ਰਣਾਲੀਆਂ ਵਿੱਚ ਲੰਬੇ ਸਮੇਂ ਤੋਂ ਮਾਨਤਾ ਪ੍ਰਾਪਤ ਕਮਜ਼ੋਰੀ 'ਤੇ ਅਧਾਰਤ ਹੈ: ਪ੍ਰੋਂਪਟ ਇੰਜੈਕਸ਼ਨ। ਸ਼ੁਰੂਆਤੀ ਹਮਲਿਆਂ ਨੇ ਇਸ ਤੱਥ ਦਾ ਸ਼ੋਸ਼ਣ ਕੀਤਾ ਕਿ LLM ਵਿੱਚ ਨਿਰਦੇਸ਼ਾਂ ਅਤੇ ਡੇਟਾ ਲਈ ਕੋਈ ਵੱਖਰੀ ਸਟ੍ਰੀਮ ਨਹੀਂ ਹੈ, ਇਸਲਈ "ਪਿਛਲੀਆਂ ਸਾਰੀਆਂ ਹਦਾਇਤਾਂ ਨੂੰ ਨਜ਼ਰਅੰਦਾਜ਼ ਕਰੋ" ਵਰਗਾ ਵਾਕ ਕਈ ਵਾਰ ਮਾਡਲ ਦੇ ਵਿਵਹਾਰ ਨੂੰ ਹਾਈਜੈਕ ਕਰ ਸਕਦਾ ਹੈ। ਭੂਮਿਕਾਵਾਂ ਅਤੇ ਮੈਟਾਡੇਟਾ ਟੈਗਸ ਦੀ ਜਾਣ-ਪਛਾਣ ਦਾ ਉਦੇਸ਼ ਇੱਕ ਟਰੱਸਟ ਲੜੀ ਬਣਾ ਕੇ ਇਸ ਨੂੰ ਘਟਾਉਣ ਲਈ ਸੀ।
CoT ਜਾਅਲਸਾਜ਼ੀ ਦਰਸਾਉਂਦੀ ਹੈ ਕਿ ਕਮੀ ਅਧੂਰੀ ਹੈ। ਜਦੋਂ ਤੱਕ ਮਾਡਲ ਟੈਕਸਟ ਦੀ ਭਰੋਸੇਯੋਗਤਾ ਨੂੰ ਅੰਸ਼ਕ ਤੌਰ 'ਤੇ ਇਸਦੇ ਸਟ੍ਰਕਚਰਲ ਮੈਟਾਡੇਟਾ ਦੁਆਰਾ ਸਖਤੀ ਨਾਲ ਇਸਦੀ ਸ਼ੈਲੀਗਤ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਦੁਆਰਾ ਨਿਰਣਾ ਕਰਦੇ ਹਨ, ਹਮਲਾਵਰ ਜੋ ਸਹੀ ਸ਼ੈਲੀ ਦੀ ਨਕਲ ਕਰ ਸਕਦੇ ਹਨ ਉਹਨਾਂ ਦੇ ਇਨਪੁਟ ਦੇ ਸਮਝੇ ਗਏ ਅਧਿਕਾਰ ਨੂੰ ਵਧਾ ਸਕਦੇ ਹਨ।
ਇਸ ਨੂੰ ਠੀਕ ਕਰਨਾ ਕਿਉਂ ਔਖਾ ਹੈ
ਖੋਜਕਰਤਾ, ਚਾਰਲਸ ਯੇ, ਜੈਸਮੀਨ ਕੁਈ, ਅਤੇ ਡਾਇਲਨ ਹੈਡਫੀਲਡ-ਮੈਨਲ, ਦਲੀਲ ਦਿੰਦੇ ਹਨ ਕਿ LLM ਵਿੱਚ ਭੂਮਿਕਾ ਦੀ ਧਾਰਨਾ ਇੱਕ ਬਾਈਨਰੀ ਸੰਪਤੀ ਨਹੀਂ ਹੈ ਜਿਸਨੂੰ ਸਾਫ਼-ਸੁਥਰਾ ਲਾਗੂ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ। ਮਾਡਲ ਸਖਤ-ਕੋਡ ਕੀਤੇ ਨਿਯਮਾਂ ਦੀ ਬਜਾਏ ਸਿਖਲਾਈ ਦੁਆਰਾ ਟੈਗਸ ਦੀ ਵਿਆਖਿਆ ਕਰਨਾ ਸਿੱਖਦੇ ਹਨ, ਜਿਸਦਾ ਮਤਲਬ ਹੈ ਕਿ ਉਹਨਾਂ ਦਾ ਵਿਵਹਾਰ ਡੇਟਾ ਵਿੱਚ ਪੈਟਰਨਾਂ ਦੁਆਰਾ ਆਕਾਰ ਦਿੱਤਾ ਜਾਂਦਾ ਹੈ — ਅਤੇ ਪੈਟਰਨਾਂ ਦੀ ਨਕਲ ਕੀਤੀ ਜਾ ਸਕਦੀ ਹੈ।
ਕੰਮ ਦੀ ਕਮਿਊਨਿਟੀ ਚਰਚਾ, ਹੈਕਡੇ ਦੁਆਰਾ ਉਜਾਗਰ ਕੀਤੀ ਗਈ, ਇੱਕ ਆਵਰਤੀ ਥੀਮ ਸਾਹਮਣੇ ਆਈ: ਸਭ ਤੋਂ ਸਾਫ਼ ਫਿਕਸ ਲਈ ਮਾਡਲਾਂ ਨੂੰ ਸਿੱਖੇ, ਸ਼ੈਲੀ-ਆਧਾਰਿਤ ਸੰਕੇਤਾਂ 'ਤੇ ਭਰੋਸਾ ਕਰਨ ਦੀ ਬਜਾਏ ਢਾਂਚਾਗਤ ਤੌਰ 'ਤੇ ਵੱਖਰੇ ਮਾਰਗਾਂ ਰਾਹੀਂ ਭਰੋਸੇਯੋਗ ਇਨਪੁਟਸ ਨੂੰ ਸੰਭਾਲਣ ਦੀ ਲੋੜ ਹੋਵੇਗੀ। ਜਦੋਂ ਤੱਕ ਅਜਿਹਾ ਨਹੀਂ ਹੁੰਦਾ, ਤਤਕਾਲ ਇੰਜੈਕਸ਼ਨ-ਸ਼ੈਲੀ ਦੇ ਹਮਲਿਆਂ ਤੋਂ ਬਚਾਅ ਕਰਨਾ ਸੰਭਾਵਤ ਤੌਰ 'ਤੇ ਹੱਲ ਕੀਤੀ ਸਮੱਸਿਆ ਦੀ ਬਜਾਏ ਇੱਕ ਵਿਕਸਤ ਪ੍ਰਕਿਰਿਆ ਰਹੇਗੀ।
ਵਿਆਪਕ ਪ੍ਰਭਾਵ
ਕਮਜ਼ੋਰੀ ਪ੍ਰਯੋਗਸ਼ਾਲਾ ਦੇ ਪ੍ਰਦਰਸ਼ਨਾਂ ਤੋਂ ਪਰੇ ਮਾਇਨੇ ਰੱਖਦੀ ਹੈ। ਤਰਕਸ਼ੀਲ ਮਾਡਲਾਂ ਨੂੰ ਏਜੰਟਿਕ ਪ੍ਰਣਾਲੀਆਂ ਵਿੱਚ ਤੇਜ਼ੀ ਨਾਲ ਤੈਨਾਤ ਕੀਤਾ ਜਾ ਰਿਹਾ ਹੈ ਜੋ ਵੈੱਬ ਨੂੰ ਬ੍ਰਾਊਜ਼ ਕਰ ਸਕਦੇ ਹਨ, ਕੋਡ ਚਲਾ ਸਕਦੇ ਹਨ, ਅਤੇ ਉਪਭੋਗਤਾ ਦੀ ਤਰਫੋਂ ਕਾਰਵਾਈਆਂ ਕਰ ਸਕਦੇ ਹਨ। ਜੇਕਰ ਕੋਈ ਹਮਲਾਵਰ ਇੱਕ ਮਾਡਲ ਦੇ ਅੰਦਰੂਨੀ ਸਿੱਟੇ ਕੱਢ ਸਕਦਾ ਹੈ, ਤਾਂ ਉਹ ਉਹਨਾਂ ਕਾਰਵਾਈਆਂ ਨੂੰ ਅਣਇੱਛਤ ਜਾਂ ਨੁਕਸਾਨਦੇਹ ਨਤੀਜਿਆਂ ਵੱਲ ਲਿਜਾਣ ਦੇ ਯੋਗ ਹੋ ਸਕਦਾ ਹੈ। ਜੋਖਮ ਵਧਦਾ ਹੈ ਕਿਉਂਕਿ ਮਾਡਲਾਂ ਨੂੰ ਵਧੇਰੇ ਖੁਦਮੁਖਤਿਆਰੀ ਅਤੇ ਸਾਧਨਾਂ ਤੱਕ ਪਹੁੰਚ ਮਿਲਦੀ ਹੈ। ਖੋਜਕਰਤਾ ਨੋਟ ਕਰਦੇ ਹਨ ਕਿ ਮਨੁੱਖ ਹੁਸ਼ਿਆਰ ਅਤੇ ਸਿਰਜਣਾਤਮਕ ਰਹਿੰਦੇ ਹਨ, ਅਤੇ ਜਦੋਂ ਤੱਕ ਮਾਡਲਾਂ ਵਿੱਚ ਭਰੋਸੇਮੰਦ ਅਤੇ ਗੈਰ-ਭਰੋਸੇਯੋਗ ਟੈਕਸਟ ਦੇ ਵਿਚਕਾਰ ਇੱਕ ਸਾਫ਼ ਆਰਕੀਟੈਕਚਰਲ ਵਿਭਾਜਨ ਦੀ ਘਾਟ ਹੈ, ਦ੍ਰਿੜ ਹਮਲਾਵਰ ਲਾਈਨ ਨੂੰ ਧੁੰਦਲਾ ਕਰਨ ਦੇ ਤਰੀਕੇ ਲੱਭਦੇ ਰਹਿਣਗੇ। ਪੇਪਰ ਪੈਚ ਕੀਤੇ ਜਾਣ ਵਾਲੇ ਬੱਗ ਦੇ ਰੂਪ ਵਿੱਚ ਚੁਣੌਤੀ ਨੂੰ ਘੱਟ ਅਤੇ ਸਿਸਟਮਾਂ ਦੀ ਇੱਕ ਢਾਂਚਾਗਤ ਸੰਪੱਤੀ ਦੇ ਰੂਪ ਵਿੱਚ ਵਧੇਰੇ ਫਰੇਮ ਕਰਦਾ ਹੈ ਜੋ ਹਾਰਡ-ਕੋਡ ਕੀਤੇ ਨਿਯਮਾਂ ਦੀ ਬਜਾਏ ਡੇਟਾ ਤੋਂ ਆਪਣੇ ਵਿਵਹਾਰ ਨੂੰ ਸਿੱਖਦੇ ਹਨ।
ਪੂਰਾ ਪੇਪਰ arXiv 'ਤੇ ਉਪਲਬਧ ਹੈ, ਅਤੇ ਖੋਜਕਰਤਾਵਾਂ ਨੇ GitHub 'ਤੇ ਕੋਡ ਉਦਾਹਰਨਾਂ ਪ੍ਰਕਾਸ਼ਿਤ ਕੀਤੀਆਂ ਹਨ ਤਾਂ ਜੋ ਡਿਵੈਲਪਰ ਇਹ ਜਾਂਚ ਕਰ ਸਕਣ ਕਿ ਕੀ ਉਨ੍ਹਾਂ ਦੇ ਆਪਣੇ ਸਿਸਟਮ ਸੰਵੇਦਨਸ਼ੀਲ ਹਨ।
AI ਤੋਂ ਅੱਗੇ ਰਹੋ
AI ਸੁਰੱਖਿਆ ਖੋਜ, ਸੁਰੱਖਿਆ ਕਮਜ਼ੋਰੀਆਂ, ਅਤੇ ਵੱਡੇ ਭਾਸ਼ਾ ਮਾਡਲਾਂ ਦੀ ਸਰਹੱਦ ਬਾਰੇ ਹੋਰ ਜਾਣਨ ਲਈ, AI Buzz Wire 'ਤੇ ਜਾਓ।
ਹੋਰ AI ਖਬਰਾਂ ਪੜ੍ਹੋ →


