An toàn AINghiên cứu 🇺🇸 12.08.2026 04:03

Phương pháp mới trích xuất suy luận ẩn từ các mô hình AI tiên tiến

OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind Moonshot AIMoonshot AI DeepSeekDeepSeek Alibaba/QwenAlibaba/Qwen
Các nhà nghiên cứu đã tìm ra cách trích xuất suy luận ẩn của các mô hình AI tiên tiến, có khả năng kích hoạt các cuộc tấn công chưng cất và tiết lộ thông tin riêng tư. Họ đã xác định vấn đề trong các mô hình của OpenAI, Anthropic và Google, đồng thời phát hiện rằng mô hình Kimi K3 của Trung Quốc tạo ra suy luận tương tự một cách đáng kể với Claude Opus và GPT-5.6, mặc dù chưa có bằng chứng kết luận về việc chưng cất. Các công ty đã giảm thiểu lỗ hổng nhưng chưa khắc phục hoàn toàn.
Các nhà khoa học máy tính, bao gồm Alexander Panfilov từ Đại học Tübingen, đã phát hiện ra một phương pháp để trích xuất 'suy nghĩ' ẩn giấu của các mô hình AI tiên tiến. Kỹ thuật này khai thác thực tế là các công ty cung cấp các phiên bản mô hình nhỏ hơn, ít được căn chỉnh hơn, nhưng chia sẻ cùng một khóa giải mã và sẵn sàng tiết lộ lý luận nội bộ hơn. Bằng cách cung cấp các dấu vết lý luận được mã hóa cho các mô hình nhỏ hơn này, các nhà nghiên cứu có thể phát hiện ra lý luận của các mô hình lớn hơn, có khả năng cho phép các cuộc tấn công chưng cất và lộ thông tin cá nhân như khóa API và mật khẩu. Họ phát hiện ra rằng mô hình Kimi K3 của Trung Quốc từ Moonshot AI tạo ra lý luận tương tự một cách đáng kinh ngạc với Claude Opus 4.8 và GPT-5.6 Sol, nhưng lưu ý rằng điều này không chứng minh một cách nhân quả về sự chưng cất. Lỗ hổng này đã được báo cáo cho OpenAI, Anthropic và Google, những công ty đã triển khai các biện pháp giảm thiểu, nhưng Panfilov nói rằng một số dấu vết lý luận vẫn có thể được trích xuất. Vấn đề này làm nổi bật tầm quan trọng địa chính trị ngày càng tăng của việc chưng cất, vì các công ty Trung Quốc bị cáo buộc sử dụng nó để sao chép các mô hình của Mỹ, mặc dù các chuyên gia còn chia rẽ về tác động thực sự của nó.
Nguồn: Wired AI — bản gốc
Bài viết liên quan trước đây ↓
Tin mới