Khối Suy Luận Mã Hóa của Claude: Nhìn Sâu Vào Từng Byte Trong Chữ Ký
Anthropic
Một bài viết trên Habr phân tích các khối suy luận mã hóa của các mẫu Claude, tiết lộ rằng trường 'signature' là một protobuf làm rò rỉ siêu dữ liệu như ID mẫu và UUID tổ chức dưới dạng văn bản thuần. Tác giả cho thấy phần suy luận thực tế được mã hóa bằng AES-GCM, nhưng độ dài của nó có thể được suy ra và siêu dữ liệu này gây rủi ro về quyền riêng tư nếu nhật ký được chia sẻ.
Một bài viết mới trên Habr trình bày chi tiết cách trích xuất chuỗi suy luận ẩn từ các mô hình đóng bằng cách khai thác một lỗ hổng: kẻ tấn công lấy một khối mã hóa từ một mô hình mạnh, đưa nó cho một mô hình yếu hơn cùng nhà cung cấp, và yêu cầu kể lại nguyên văn, từ đó đọc được suy nghĩ ban đầu, bao gồm cả mật khẩu hoặc khóa vô tình bị lẫn vào. Tác giả tiết lộ rằng trường 'chữ ký' được gắn vào mọi khối suy luận của Claude không phải là không thể đọc được: nó là một protobuf có thể phân tích mà không cần bất kỳ khóa nào. Bên trong, chỉ có văn bản suy luận thực sự được mã hóa (AES-GCM, với thẻ 16 byte), trong khi lớp vỏ ngoài và tiêu đề chứa siêu dữ liệu dạng văn bản thuần túy. Tiêu đề bao gồm mã mô hình (ví dụ: 'claude-opus-5'), loại khối và, kể từ phiên bản 15 (tháng 7 năm 2026), mã định danh tổ chức (UUID) từ tệp ~/.claude.json của người dùng. Siêu dữ liệu này được bảo vệ bằng mã xác thực thông điệp (MAC), do đó không thể giả mạo các khối, nhưng nếu bị lộ trong nhật ký, nó có thể liên kết người dùng với tổ chức và mức sử dụng mô hình của họ. Tác giả cho rằng lỗ hổng được mô tả trong bản in trước có thể được giảm thiểu nhờ sự hiện diện của siêu dữ liệu này, nhưng rủi ro thực tế là tiêu đề không được mã hóa làm rò rỉ thông tin nhạy cảm khi nhật ký của tác nhân (agent) được chia sẻ.
Nguồn: Habr — хаб ИИ —
bản gốc
