Suy nghĩ của AI có thể bị đọc bằng một AI khác, lộ mật khẩu và chìa khóa bên trong
Anthropic
OpenAI
Google/DeepMind
Các nhà nghiên cứu đã chứng minh một cuộc tấn công có thể giải mã các dấu vết suy luận ẩn của các mô hình ngôn ngữ lớn độc quyền từ Anthropic, OpenAI và Google thông qua hai lệnh gọi API, mà không cần tấn công trực tiếp vào mô hình mục tiêu. Phương pháp này cũng phát hiện ra rằng các nhật ký đại lý công khai chứa hàng trăm bí mật, bao gồm mật khẩu và chìa khóa, được ẩn giấu bên trong các khối mã hóa.
Tám nhà nghiên cứu từ ELLIS Institute Tübingen, Max Planck Institute for Intelligent Systems, Tübingen AI Center, MATS và Snyk đã công bố một bản preprint (bản thảo chưa qua bình duyệt) vào ngày 10 tháng 8, mô tả một cuộc tấn công nhằm vào các đoạn suy luận (reasoning traces) đã được mã hóa của các mô hình từ Anthropic, OpenAI và Google. Cuộc tấn công hoạt động bằng cách lấy khối dữ liệu đã mã hóa từ một mô hình mạnh (ví dụ: Claude Opus 4.8) và đưa nó cho một mô hình yếu hơn cùng nhà cung cấp (ví dụ: Haiku 4.5), sau đó yêu cầu mô hình yếu này viết lại nguyên văn phần suy luận, từ đó giải mã nó. Cuộc tấn công này không phá vỡ cơ chế mã hóa hay tấn công trực tiếp vào mô hình mạnh; nó khai thác việc khối dữ liệu đã mã hóa được trả về cho client và phải được gửi lại kèm với yêu cầu tiếp theo. Các nhà nghiên cứu đã xác minh tính xác thực của các đoạn suy luận đã giải mã trên 120 bài toán Codeforces. Họ cũng đã quét 6708 log tác vụ (agent logs) công khai từ GitHub và Hugging Face, khôi phục được 315.320 khối suy luận, trong đó chứa 704 thông tin bí mật (secrets) độc nhất, bao gồm 62 khóa API (API keys), 33 mật khẩu, 24 token truy cập (access tokens), cùng với các địa chỉ email, tên người dùng và URL nội bộ. Đáng chú ý, 64 trong số các thông tin bí mật này không hiện diện ở bất kỳ đâu trong phiên làm việc hiển thị, mà chỉ tồn tại bên trong các khối dữ liệu đã mã hóa. Bài báo cũng mô tả một hướng tấn công đầu độc (poisoning vector), trong đó một khối dữ liệu độc hại có thể được cài đặt sẵn để tiêm các chỉ dẫn (inject instructions) vào một agent khi agent đó tải khối dữ liệu này về sau. Các tác giả đề xuất các biện pháp mật mã học và hệ thống để ràng buộc khối dữ liệu với phiên làm việc, người dùng và mô hình cụ thể, nhưng trong lúc chờ đợi, người dùng nên coi các khối suy luận đã mã hóa như những thông tin bí mật và tránh chia sẻ log công khai.
Nguồn: Habr — хаб ИИ —
bản gốc
