Nghiên cứuAn toàn AI 🇩🇪 09.08.2026 12:02

Anthropic xác định 'Không gian tư duy' ẩn trong các mô hình AI Claude

AnthropicAnthropic MicrosoftMicrosoft
Các nhà nghiên cứu Anthropic đã xác định một khu vực xử lý nội bộ tự phát trong các mô hình ngôn ngữ Claude, được đặt tên là 'J-Space', nơi AI dường như lưu trữ và xử lý ý tưởng mà không truyền đạt cho người dùng. Phát hiện này đặt ra câu hỏi về mức độ gần gũi của tư duy AI với nhận thức của con người và ý nghĩa của nó trong việc phát hiện ý định tiềm ẩn của AI.
Anthropic đã xác định được một không gian làm việc nội bộ tự phát trong các mô hình ngôn ngữ Claude của mình, được gọi là 'J-Space' theo tên phương pháp Jacobi được sử dụng để truy vết các quá trình này. Trong không gian này, AI dường như lập kế hoạch và xử lý ý tưởng một cách riêng biệt với 'chuỗi suy nghĩ' mà nó chia sẻ với người dùng, tương tự như cách con người nghĩ về một việc trong khi làm một việc khác. Các nhà nghiên cứu đã quan sát thấy Claude thực hiện các nhiệm vụ tinh thần như phát hiện lỗi mã và nhận dạng hình ảnh mà không nói thành lời các bước này. Hành vi này có nét tương đồng với lý thuyết không gian làm việc toàn cầu của Bernard Baars, mặc dù kiến trúc của các mô hình ngôn ngữ về cơ bản khác biệt với bộ não con người. Khám phá này có thể giúp tiết lộ các ý định ẩn giấu hoặc sự lệch lạc trong các mô hình AI. Tuy nhiên, các chuyên gia cảnh báo không nên nhân cách hóa AI, vì giám đốc AI của Microsoft, Mustafa Suleyman, đã cảnh báo rằng tin vào 'AI có ý thức' có thể gây ra những hậu quả nghiêm trọng. Bài nghiên cứu của Anthropic sử dụng từ 'có ý thức' hơn 200 lần, và công ty gần đây đã giới thiệu một tính năng 'mơ' trong đó Claude xử lý thông tin giữa các phiên làm việc.
Nguồn: t3n — bản gốc
Bài viết liên quan trước đây ↓
Tin mới