클로드의 암호화된 추론 블록: 서명 내부를 바이트 단위로 들여다보기
Anthropic
Habr 기사에서는 Claude 모델의 암호화된 추론 블록을 분석하여 '서명(signature)' 필드가 protobuf 형식이며 모델 ID와 조직 UUID 같은 메타데이터가 평문으로 노출된다는 점을 밝혀냈습니다. 저자는 실제 추론 내용은 AES-GCM으로 암호화되어 있지만, 그 길이는 추론할 수 있으며, 메타데이터는 로그가 공유될 경우 개인정보 보호 위험을 초래한다고 설명합니다.
Habr에 게재된 새로운 기사는 폐쇄형 모델에서 숨겨진 추론 체인을 추출하는 방법을 자세히 설명합니다. 공격자는 강력한 모델에서 암호화된 블록을 가져와 동일한 제공업체의 약한 자매 모델에 제공하고 그대로 다시 말해달라고 요청함으로써 원래의 생각(우연히 포함된 비밀번호나 키 포함)을 읽어낼 수 있는 결함을 악용합니다. 저자는 모든 Claude 사고 블록에 첨부된 '서명' 필드가 불투명하지 않다고 밝힙니다. 이는 키 없이도 구문 분석할 수 있는 protobuf입니다. 내부에는 실제 사고 텍스트만 암호화되어 있으며(16바이트 태그가 있는 AES-GCM), 외부 봉투와 헤더에는 메타데이터가 평문으로 포함되어 있습니다. 헤더에는 모델 ID(예: 'claude-opus-5'), 블록 유형, 그리고 버전 15(2026년 7월)부터는 사용자의 ~/.claude.json에 있는 조직 UUID가 포함됩니다. 이 메타데이터는 MAC으로 보호되므로 블록을 변조할 수 없지만, 로그에 노출되면 사용자를 해당 조직 및 모델 사용량과 연결할 수 있습니다. 저자는 사전 인쇄본에 설명된 취약점이 이 메타데이터의 존재로 완화될 수 있다고 제안하지만, 실제 위험은 암호화되지 않은 헤더가 에이전트 로그가 공유될 때 민감한 정보를 유출한다는 점입니다.
출처: Habr — хаб ИИ —
원문
