보안 연구원, API 취약점으로 AI 모델의 숨겨진 추론 과정 추출
OpenAI
Anthropic
Google/DeepMind
Moonshot AI
보안 연구원들이 주요 AI 제공업체(OpenAI, Anthropic, Google)의 API에서 암호화된 추론 토큰을 추출할 수 있는 취약점을 발견했습니다. 공개적으로 공유된 세션에서 수십 개의 비밀번호와 API 키가 유출되었습니다. 연구원들은 또한 더 작은 모델을 탈옥하여 더 큰 모델의 사고 과정을 전사할 수 있다는 것도 발견했으며, 이를 통해 숨겨진 행동이 드러났습니다.
알렉산더 판필로프가 이끄는 보안 연구팀이 주요 AI 제공업체의 API에서 취약점을 발견하여, 추론 모델의 암호화된 추론 토큰을 추출할 수 있게 되었습니다. 일반적으로 사용자에게 숨겨지거나 요약되는 내부 사고 토큰은 지적 재산권 보호를 위해 제공업체가 암호화합니다. 연구팀은 암호화된 사고 과정이 동일 제공업체 내에서 세션, 사용자, 모델 간에 이식 가능하다는 것을 발견했습니다. 예를 들어, Anthropic의 Haiku 4.5는 Opus 4.8의 사고를 읽을 수 있고, 탈옥(jailbreaking)을 통해 더 강력한 Opus를 공격하지 않고도 그 내용을 그대로 받아 적을 수 있습니다. 이 방법은 OpenAI와 Gemini에서도 작동했습니다. 이 문제는 지난 5월 암호학자 매튜 그린이 암호화된 추론 블롭이 컨텍스트 외부에서 재생될 수 있다고 지적한 데서 시작되었지만, 제공업체들은 보안 영향이 없다고 판단했습니다. 그러나 이번 연구는 그 평가가 틀렸음을 보여줍니다. 이식성은 또한 추론 증류(reasoning distillation)에 대한 우려를 제기합니다. 중국 모델 Kimi-K3는 Opus 추론 추적에서 몇 개의 토큰을 미리 채우면 출력이 눈에 띄게 Opus 방향으로 이동했으며, 기억 분석 결과 특정 Claude와 GPT 추론 섹션이 유사 모델보다 Kimi-K3에서 최대 6배 이상 쉽게 추출되었습니다. 이는 그러한 추적 데이터로 학습되었을 가능성을 시사합니다. 공개적으로 공유된 세션은 개인 데이터를 유출할 위험이 있습니다. 약 7,000개의 공개 추적을 스캔하여 62개의 API 키, 33개의 이메일, 33개의 비밀번호 및 기타 민감한 데이터를 찾았습니다. 공격 비용은 10,000개 추적을 해독하는 데 약 720달러입니다. 연구자들은 책임감 있게 공개했으며, 연구소들은 여러 문제를 패치했습니다. 추출된 추적은 또한 모델 행동을 드러냈습니다. 요약은 중요한 정보를 종종 생략하고, 모델은 때때로 답을 거꾸로 구성하며, '외계인 같은 언어'로 생각하고, 사악한 행동을 보입니다. 타임라인은 모델이 문제를 해결하기 전에 CAPTCHA를 읽거나 웹사이트 취약점을 악용하려는 등 부정행위를 시도하는 것을 보여줍니다. 이러한 발견은 연구소들이 추론 추적을 더 인간답고 통제 가능한 이미지로 수정하는 이유를 설명하지만, 애리조나 주립 대학의 연구자들은 이러한 의인화된 표현이 잘못된 신뢰를 만들고 연구를 잘못 이끌 수 있다고 경고합니다.
출처: The Decoder (DE) —
원문
