AI 안전 🇷🇺 11.08.2026 21:02

AI의 생각을 다른 AI로 읽어내, 내부의 비밀번호와 키가 드러나

AnthropicAnthropic OpenAIOpenAI Google/DeepMindGoogle/DeepMind
연구진이 Anthropic, OpenAI, Google의 독점 LLM 내부 숨은 추론 흔적을 두 번의 API 호출로 해독하는 공격을 시연했으며, 이는 대상 모델을 공격하지 않고 수행됩니다. 이 방법은 또한 공개 에이전트 로그에 수백 개의 비밀번호와 키가 암호화 블록 안에 숨겨져 있음을 발견했습니다.
ELLIS 연구소 튀빙겐(ELLIS Institute Tübingen), 막스 플랑크 지능 시스템 연구소(Max Planck Institute for Intelligent Systems), 튀빙겐 AI 센터(Tübingen AI Center), MATS, 그리고 Snyk 소속 연구자 8명이 8월 10일 프리프린트를 발표했다. 이 논문은 Anthropic, OpenAI, Google의 모델들이 암호화한 추론 트레이스(reasoning trace)를 공격하는 방법을 다룬다. 이 공격은 강력한 모델(예를 들어, Claude Opus 4.8)에서 나온 암호화된 블록을 가져다가 같은 제공사의 더 약한 모델(예를 들어, Haiku 4.5)에 입력한 뒤, 해당 모델에게 그 추론 내용을 그대로 다시 써달라고 요청함으로써 결과적으로 이를 복호화하는 방식으로 작동한다. 이 공격은 암호화 자체를 깨거나 강력한 모델을 직접 공격하는 것이 아니라, 암호화된 블록이 클라이언트로 반환되어 다음 요청 시 다시 전송되어야 한다는 사실을 악용하는 것이다. 연구진은 Codeforces 문제 120개를 통해 복호화된 트레이스의 정확성을 검증했다. 또한 GitHub와 Hugging Face에 공개된 에이전트 로그 6708건을 스캔하여 315,320개의 추론 블록을 복구했으며, 이 안에는 704개의 고유한 비밀 정보가 포함되어 있었다. 여기에는 API 키 62개, 비밀번호 33개, 액세스 토큰 24개는 물론 이메일 주소, 이름, 내부 URL 등도 포함되어 있었다. 특히 주목할 점은 이 중 64개의 비밀 정보는 가시적인 세션 어디에도 나타나지 않고 오직 암호화된 블록 내부에만 존재했다는 것이다. 논문은 또한 악의적인 블록을 심어두어 이후 이를 불러오는 에이전트에게 명령을 주입할 수 있는 오염(poisoning) 공격 경로도 설명한다. 저자들은 블록을 세션, 사용자, 모델에 결속시키기 위한 암호학적·시스템적 대응책을 제안하지만, 당장은 사용자들이 암호화된 추론 블록을 비밀 정보로 취급하고 로그를 공개적으로 공유하지 않도록 해야 한다고 권고한다.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스