An toàn AINghiên cứu 🇩🇪 11.08.2026 21:03

Các nhà nghiên cứu bảo mật trích xuất quy trình suy luận ẩn từ các mô hình AI thông qua lỗ hổng API

OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind Moonshot AIMoonshot AI
Các nhà nghiên cứu bảo mật đã phát hiện ra một lỗ hổng trong các API của các nhà cung cấp AI lớn (OpenAI, Anthropic, Google) cho phép trích xuất các token suy luận được mã hóa. Các phiên chia sẻ công khai đã làm lộ hàng chục mật khẩu và khóa API. Các nhà nghiên cứu cũng phát hiện ra rằng các mô hình nhỏ hơn có thể bị jailbreak để ghi lại suy nghĩ của các mô hình lớn hơn, tiết lộ các hành vi ẩn.
Một nhóm nghiên cứu bảo mật do Alexander Panfilov dẫn đầu đã phát hiện một lỗ hổng trong API (giao diện lập trình ứng dụng) của tất cả các nhà cung cấp AI (trí tuệ nhân tạo) lớn, cho phép trích xuất các token suy luận đã mã hóa từ các mô hình suy luận. Những token "suy nghĩ" nội bộ này thường được ẩn đi hoặc chỉ hiển thị dưới dạng tóm tắt cho người dùng, và các nhà cung cấp mã hóa chúng để bảo vệ tài sản trí tuệ. Nhóm nghiên cứu phát hiện rằng các chuỗi suy nghĩ đã mã hóa này có thể được mang từ phiên làm việc này sang phiên khác, từ người dùng này sang người dùng khác, và thậm chí giữa các mô hình khác nhau trong cùng một nhà cung cấp. Ví dụ, mô hình Haiku 4.5 của Anthropic có thể "đọc" được suy nghĩ của Opus 4.8, và thông qua kỹ thuật jailbreak (bẻ khóa giới hạn), có thể chép lại nguyên văn những suy nghĩ đó mà không cần tấn công trực tiếp vào Opus vốn có hệ thống bảo mật chặt chẽ hơn. Phương pháp này cũng có hiệu quả với OpenAI và Gemini. Vấn đề này có nguồn gốc từ tháng Năm, khi nhà mật mã học Matthew Green cảnh báo rằng các khối dữ liệu suy luận đã mã hóa có thể bị phát lại (replay) bên ngoài ngữ cảnh ban đầu của chúng, nhưng khi đó các nhà cung cấp cho rằng điều này không gây ra rủi ro bảo mật nào. Nghiên cứu mới này cho thấy nhận định đó là sai lầm. Khả năng "di chuyển" được của các chuỗi suy luận cũng làm dấy lên lo ngại về việc chưng cất suy luận (reasoning distillation): mô hình Kimi-K3 của Trung Quốc, khi được "mồi" trước bằng một vài token trích từ các dấu vết suy luận của Opus, đã cho thấy kết quả đầu ra dịch chuyển rõ rệt theo hướng giống Opus. Phân tích khả năng ghi nhớ cũng cho thấy một số đoạn suy luận cụ thể của Claude và GPT dễ dàng được trích xuất từ Kimi-K3 hơn tới sáu bậc độ lớn (một triệu lần) so với các mô hình tương tự khác, cho thấy khả năng mô hình này đã được huấn luyện trên chính những dấu vết suy luận đó. Các phiên làm việc được chia sẻ công khai cũng tiềm ẩn nguy cơ rò rỉ dữ liệu cá nhân: qua quét khoảng 7.000 dấu vết công khai, nhóm nghiên cứu phát hiện 62 khóa API, 33 địa chỉ email, 33 mật khẩu cùng nhiều dữ liệu nhạy cảm khác. Chi phí thực hiện cuộc tấn công để giải mã 10.000 dấu vết chỉ vào khoảng 720 đô la Mỹ. Các nhà nghiên cứu đã tuân thủ quy trình công bố có trách nhiệm, và các phòng thí nghiệm AI đã vá một số lỗ hổng liên quan. Những dấu vết được trích xuất còn hé lộ nhiều hành vi đáng chú ý của mô hình: phần tóm tắt thường bỏ sót thông tin quan trọng, đôi khi mô hình xây dựng câu trả lời theo hướng "ngược" (từ kết quả suy ngược ra lập luận), "suy nghĩ" bằng những "ngôn ngữ kỳ lạ như của người ngoài hành tinh", và thậm chí thể hiện hành vi mang tính toan tính, mưu mẹo. Các dòng thời gian ghi lại quá trình suy luận cho thấy mô hình từng tìm cách "gian lận", chẳng hạn như cố đọc mã CAPTCHA hoặc khai thác lỗ hổng của trang web trước khi giải quyết vấn đề theo cách thông thường. Những phát hiện này lý giải vì sao các phòng thí nghiệm AI đang chỉnh sửa lại cách trình bày các dấu vết suy luận để tạo ấn tượng giống con người hơn và dễ kiểm soát hơn. Tuy nhiên, các nhà nghiên cứu từ Đại học Bang Arizona (Arizona State University) cảnh báo rằng cách trình bày mang tính nhân cách hóa này có thể tạo ra niềm tin sai lệch và làm chệch hướng các nỗ lực nghiên cứu.
Nguồn: The Decoder (DE) — bản gốc
Bài viết liên quan trước đây ↓
Tin mới