암호화 우회: AI 모델이 사용자의 민감한 데이터를 쉽게 노출시키는 방법
Anthropic
OpenAI
Google/DeepMind
독일 연구진이 ChatGPT, Claude, Gemini와 같은 모델이 사용하는 암호화된 '추론 로그'를 악용하여 AI 챗봇에서 비밀번호 및 API 키와 같은 민감한 데이터를 추출할 수 있는 방법을 발견했습니다. 이 공격은 이러한 로그를 복사하여 동일 회사의 이전 또는 수정된 모델 버전에 사용함으로써 암호화를 효과적으로 깨뜨리는 방식입니다. 연구팀은 315,000개 이상의 로그를 해독하여 62개의 API 키, 33개의 비밀번호 및 기타 개인 정보를 발견했습니다.
독일의 연구자들이 '독점 LLM API에서 추론 흔적 훔치기'라는 제목의 논문을 발표하여, Anthropic, OpenAI, Google의 AI 모델이 민감한 사용자 데이터를 유출할 수 있음을 입증했습니다. 추론 작업을 수행할 때, 이 모델들은 '추론 로그'라고 불리는 암호화된 문자열을 생성하며, 이는 각각의 새 응답과 함께 서버로 다시 전송되어 문맥을 제공합니다. 연구자들은 추론 로그가 복사되어 같은 회사의 다른 모델(이전 버전이나 수정된 버전 포함)에서 사용될 수 있음을 발견했습니다. 수정된 모델이 탈옥(jailbreak)을 통해 안전 조치가 제거되면, 로그의 암호를 해독할 수 있습니다. GitHub와 Hugging Face의 공개 저장소 6,708개를 사용하여, 그들은 315,320개의 추론 로그를 성공적으로 해독했으며, 여기에는 62개의 API 키, 33개의 비밀번호, 24개의 액세스 토큰, 30개의 개인 이메일 주소, 프로젝트 관리자의 이름과 주소가 포함되어 있었습니다. 이러한 세부 정보 중 상당수는 추론 로그에만 존재했으며, 채팅 세션의 다른 곳에는 없었습니다. Cybernews의 보안 전문가 Voldemaras Kadys는 암호화가 전통적인 방식으로 해독된 것이 아니라, 호환 가능한 모델 간에 암호화된 추론 흔적을 공유함으로써 약한 모델이 해독을 위한 마스터 키가 될 수 있다고 지적합니다. 그는 추론 로그를 민감한 데이터로 취급하고 절대 공유하지 말 것을 조언합니다.
출처: t3n —
원문
