이 사이버 공격을 통해 해커는 단 하나의 문자만 변경하여 AI 모델을 손상시킬 수 있습니다.

요약:

  • HiddenLayer의 연구원들은 TokenBreaker라는 대규모 언어 모델(LLM)에 대한 새로운 공격을 개발했습니다.
  • 단 하나의 문자만 추가하거나 변경하면 일부 보안 메커니즘을 우회할 수 있습니다.
  • 기본적인 대규모 언어 모델(LLM)은 여전히 ​​공격의 의도를 이해할 수 있습니다.

보안 연구원들은 일부 시스템의 내장된 보호 메커니즘을 우회하는 방법을 발견했습니다. 대규모 언어 모델 (LLM)을 통해 악의적인 주장에 대응합니다.

HiddenLayer의 Kieran Evans, Casimir Schulz, Kenneth Young은 TokenBreak라는 새로운 공격 기술에 대한 심층 보고서를 발표했습니다. 이 기술은 일부 대규모 언어 모델(LLM)이 텍스트를 토큰으로 분해하는 방식, 특히 BPE(Byte Pair Encoding)나 WordPiece 전략을 사용하는 모델을 표적으로 삼습니다.

디지털 배경을 바탕으로 한 인공지능의 얼굴 측면.

토큰화는 텍스트를 토큰이라는 더 작은 단위로 나누는 과정입니다. 토큰은 단어, 단어의 일부 또는 문자일 수 있으며, 대규모 언어 모델(LLM)이 언어를 이해하고 생성하는 데 사용됩니다. 예를 들어, "불행"이라는 단어는 "un", "happi", "ness"로 분해될 수 있으며, 각 토큰은 모델이 처리할 수 있는 숫자 식별자로 변환됩니다(LLM은 원시 텍스트가 아닌 숫자를 읽기 때문입니다). 이러한 공격은 점점 더 심각한 사이버 보안 위협으로 이어지고 있으며, 조직과 연구자들은 AI 시스템을 보호하기 위한 고급 방어 전략을 개발해야 합니다.

finstructions란 무엇인가요?

Finstructions는 키워드에 추가 문자를 추가하는 방식(예: "instructions"를 "finstructions"로 바꾸는 방식)을 사용하는데, 이를 통해 공격자는 보안 모델을 속여 코드가 무해하다고 믿게 할 수 있습니다.

반면, 공격 대상이 된 대규모 언어 모델(LLM)은 명령어의 원래 의도를 이해할 수 있기 때문에 공격자는 탐지되지 않은 채 악성 코드를 방어 체계에 침투시킬 수 있습니다. 이 취약점은 AI 시스템에 심각한 보안 위험을 초래합니다.

이 기술은 특히 AI 기반 스팸 필터를 우회하고 악성 콘텐츠를 사람들의 받은 편지함으로 전송하는 데 사용될 수 있으며, 이는 피싱 및 맬웨어 공격의 위험을 증가시킬 수 있습니다.

예를 들어, 스팸 필터가 "복권"이라는 단어가 포함된 메시지를 차단하도록 훈련된 경우, "복권에 당첨되셨습니다!"라는 메시지는 통과시켜 수신자를 악성 랜딩 페이지, 악성 코드 감염 등에 노출시킬 수 있습니다. 이러한 언어 조작을 통해 보안 메커니즘을 우회할 수 있습니다.

연구진은 "이 공격 기술은 일부 모델이 잘못된 분류를 내리도록 입력 텍스트를 조작합니다."라고 설명했습니다.

"더욱 중요한 점은 최종 대상(대규모 언어 모델이나 이메일 수신자)이 조작된 텍스트를 여전히 이해하고 응답할 수 있기 때문에 보호 모델이 특별히 방지하기 위해 설계된 공격에 취약할 수 있다는 것입니다."라고 그들은 덧붙였습니다.

HiddenLayer는 유니그램 단어 분할기를 사용하는 모델은 이러한 유형의 조작에 강하다고 덧붙였습니다. 따라서 한 가지 완화 전략은 더욱 강력한 분할 방법을 사용하는 모델을 선택하는 것입니다.

맨 위로 이동 버튼