선도 AI 모델에서 숨겨진 추론 과정을 추출하는 새로운 방법
OpenAI
Anthropic
Google/DeepMind
Moonshot AI
DeepSeek
Alibaba/Qwen
연구진이 최첨단 AI 모델의 숨겨진 추론 과정을 추출하는 방법을 발견하여, 증류 공격을 가능하게 하고 개인 정보를 노출할 수 있음을 확인했습니다. 이들은 OpenAI, Anthropic, Google의 모델에서 이 문제를 식별했으며, 중국 모델 Kimi K3가 Claude Opus 및 GPT-5.6과 놀라울 정도로 유사한 추론을 생성한다는 사실을 발견했습니다(증류의 결정적 증거는 아니지만). 해당 기업들은 이 취약점을 완화했지만 완전히 수정하지는 못했습니다.
튀빙겐대학교(University of Tübingen)의 알렉산더 판필로프(Alexander Panfilov)를 포함한 컴퓨터 과학자들이 프론티어 AI 모델의 숨겨진 '사고 과정'을 추출하는 방법을 발견했다. 이 기법은 기업들이 동일한 암호 해독 키를 공유하면서도 내부 추론 과정을 더 기꺼이 드러내는, 정렬 수준이 낮은 소형 모델 변형을 제공한다는 사실을 악용한다. 연구진은 암호화된 추론 흔적을 이러한 소형 모델에 입력함으로써 대형 모델의 추론 과정을 밝혀낼 수 있었으며, 이는 증류(distillation) 공격을 가능하게 하고 API 키나 비밀번호 같은 개인정보를 노출시킬 수 있다.
연구진은 문샷AI(Moonshot AI)의 중국 모델 Kimi K3가 Claude Opus 4.8 및 GPT-5.6 Sol과 놀라울 정도로 유사한 추론 결과를 보였다는 사실을 발견했지만, 이것이 증류가 이루어졌음을 인과적으로 입증하는 것은 아니라고 밝혔다.
이 취약점은 OpenAI, Anthropic, Google에 보고되었고, 이들 기업은 완화 조치를 시행했으나, 판필로프는 여전히 일부 추론 흔적이 추출될 수 있다고 말했다. 이번 사안은 증류의 지정학적 중요성이 커지고 있음을 보여주는데, 중국 기업들은 미국 모델을 복제하기 위해 증류를 활용한다는 의혹을 받고 있지만, 그 실질적 영향에 대해서는 전문가들 사이에서도 의견이 갈리고 있다.
출처: Wired AI —
원문
