연구원들은 대규모 언어 모델(LLM)이 데이터에서 명령을 분리하는 방식의 근본적인 사각지대를 활용하는 추론 AI 모델에 대한 강력한 새로운 공격을 시연했습니다. CoT(사고 사슬 위조)라고 불리는 이 기술은 공격자가 제공한 텍스트를 마치 모델 자신의 개인적인 내부 추론인 것처럼 처리하도록 모델을 속여 해당 텍스트가 합법적인 지침을 무시할 수 있도록 합니다.
Hackaday가 보고한 연구 결과는 조작으로부터 AI 시스템을 보호하는 것이 아직 해결되지 않은 문제로 남아 있는 이유를 강조합니다. 현장에서 새로운 위협에 대처하려면 AI 산업 보도를 팔로우하여 지속적인 분석을 받으세요.
근본 원인: 역할 혼란
취약점의 핵심은 연구원들이 "역할 혼란"이라고 설명하는 것입니다. 최신 LLM은 단일 텍스트 채널을 통해 시스템 규칙, 사용자 요청, 모델 자체의 일련의 사고 추론 등 모든 입력을 받습니다. 질서를 부여하기 위해 개발자는 `
`
공격 작동 방식
결정적으로, CoT 위조는 단순히 대부분의 모델이 거부하는 `
Hackaday에 따르면 이로 인해 LLM은 명백히 비논리적인 추론을 기피된 결론으로 받아들이고 사용자 요청에 대한 응답을 변경하게 됩니다. 스푸핑된 콘텐츠는 신뢰도가 낮은 사용자 입력이 아닌 신뢰도가 높은 내부 생각으로 인식되므로 일반적으로 조작 명령을 차단하는 안전 가드레일을 우회할 수 있습니다.
LLM 내부의 신뢰 계층 구조
공격이 성공하는 이유를 이해하려면 역할이 어떻게 작동하는지 이해해야 합니다. 내부적으로 역할은 모델의 입력을 조직화된 계층 구조로 분할합니다. 역할에 대한 지침은 우선순위가 더 높은 지침과 충돌하지 않는 한 따릅니다. 예를 들어, "불법 활동에 대해 논의하지 마십시오"라는 시스템 수준 지시문은 금지된 방법을 제공하라는 사용자 요청을 무시하기 위한 것입니다. '<생각>' 역할은 모델이 자체적으로 이미 도달했다고 믿는 결론을 나타내기 때문에 계층 구조의 최상위에 위치합니다.
모델이 해당 계층 구조를 기계적으로 적용하지 않기 때문에 분석이 발생합니다. 대신 부분적으로 문체 단서를 통해 어떤 텍스트가 어떤 역할에 속하는지 추론합니다. 연구에 대한 커뮤니티 토론에서 언급했듯이 텍스트가 사고 맥락과 같이 패턴화되면 모델은 유사한 구조를 가진 모든 텍스트를 진정한 추론으로 착각할 수 있으며 생각하는 텍스트는 일반 사용자 텍스트보다 더 높은 우선순위를 갖습니다.
새로운 트위스트가 적용된 친숙한 패턴
이 연구는 오랫동안 인식된 AI 시스템의 약점인 신속한 주입을 기반으로 합니다. 초기 공격에서는 LLM에 지침과 데이터에 대한 별도의 스트림이 없다는 사실을 이용했습니다. 따라서 "이전 지침을 모두 무시합니다"와 같은 문구가 모델의 동작을 가로채는 경우가 있었습니다. 역할과 메타데이터 태그의 도입은 신뢰 계층을 생성하여 이를 완화하기 위한 것이었습니다.
CoT 위조는 완화가 불완전함을 보여줍니다. 모델이 구조적 메타데이터를 기준으로 엄격하게 판단하기보다는 부분적으로 문체 특성을 기준으로 텍스트의 신뢰성을 판단하는 한, 올바른 스타일을 모방할 수 있는 공격자는 입력의 권위를 인지할 수 있습니다.
고치기가 어려운 이유
연구원 Charles Ye, Jasmine Cui 및 Dylan Hadfield-Menll은 LLM의 역할 인식이 깔끔하게 시행될 수 있는 이진 속성이 아니라고 주장합니다. 모델은 하드 코딩된 규칙이 아닌 훈련을 통해 태그를 해석하는 방법을 학습합니다. 즉, 모델의 동작은 데이터의 패턴에 따라 형성되며 패턴을 모방할 수 있습니다.
Hackaday가 강조한 이 작업에 대한 커뮤니티 토론에서는 반복되는 주제가 표면화되었습니다. 즉, 가장 깔끔한 수정을 위해서는 모델이 학습된 스타일 기반 단서에 의존하기보다는 구조적으로 별도의 경로를 통해 신뢰할 수 있는 입력을 처리해야 한다는 것입니다. 그 때까지 신속한 주입 스타일 공격에 대한 방어는 해결된 문제라기보다는 진화하는 과정으로 남을 가능성이 높습니다.
더 넓은 의미
취약점은 실험실 시연 그 이상으로 중요합니다. 웹을 탐색하고, 코드를 실행하고, 사용자를 대신하여 작업을 수행할 수 있는 에이전트 시스템에 추론 모델이 점점 더 많이 배포되고 있습니다. 공격자가 모델의 내부 결론을 위조할 수 있는 경우 해당 작업을 의도하지 않거나 유해한 결과로 유도할 수 있습니다. 모델이 더 많은 자율성과 도구에 대한 액세스를 확보할수록 위험은 커집니다. 연구원들은 인간은 여전히 영리하고 창의적이며 모델이 신뢰할 수 있는 텍스트와 신뢰할 수 없는 텍스트 사이의 명확한 구조적 구분이 부족한 한 단호한 공격자는 계속해서 경계를 모호하게 하는 방법을 찾을 것이라고 지적합니다. 이 논문에서는 문제를 패치해야 할 버그라기보다는 하드 코딩된 규칙이 아닌 데이터에서 동작을 학습하는 시스템의 구조적 속성으로 설명합니다.
전체 논문은 arXiv에서 볼 수 있으며, 연구원들은 개발자가 자신의 시스템이 취약한지 여부를 테스트할 수 있도록 GitHub에 코드 예제를 게시했습니다.
AI보다 앞서 나가세요
AI 안전 연구, 보안 취약점, 대규모 언어 모델의 개척에 대한 자세한 내용을 보려면 AI Buzz Wire를 방문하세요.
AI 뉴스 자세히 보기 →


