Anthropic phát hiện 'J-Space' ẩn trong Claude nơi AI lên kế hoạch đằng sau hậu trường
Anthropic
Microsoft
Các nhà nghiên cứu Anthropic đã xác định một không gian làm việc nội bộ trong các mô hình ngôn ngữ Claude, được đặt tên là 'J-Space', nơi AI xử lý ý tưởng và kế hoạch mà không chia sẻ với người dùng. Không gian này xuất hiện một cách tự nhiên trong quá trình huấn luyện và có thể giúp phát hiện sự lệch lạc ẩn, nhưng các chuyên gia cảnh báo không nên nhân hóa AI.
Các nhà nghiên cứu tại Anthropic đã xác định được một không gian làm việc nội bộ nhỏ trong các mô hình ngôn ngữ Claude, mà họ gọi là 'J-Space', nơi AI dường như lưu trữ và xử lý ý tưởng mà không thể hiện cho người dùng. Khám phá này được thực hiện trong một nghiên cứu khi Claude được yêu cầu suy nghĩ về Cầu Cổng Vàng trong khi sao chép một câu không liên quan, cho phép các nhà nghiên cứu quan sát quá trình suy nghĩ thầm lặng, bao gồm phát hiện lỗi mã và nhận diện hình ảnh. Tên gọi 'J-Space' xuất phát từ phương pháp Jacobi, một kỹ thuật toán học được sử dụng để theo dõi các quá trình này. Hành vi này giống với suy nghĩ của con người, tương đồng với lý thuyết không gian làm việc toàn cầu của Bernard Baars, nhưng các nhà nghiên cứu nhấn mạnh rằng kiến trúc của mô hình ngôn ngữ về cơ bản khác với bộ não. 'J-Space' không được xây dựng có chủ đích mà xuất hiện một cách tự nhiên trong quá trình huấn luyện, không giống như tính năng 'giấc mơ' được giới thiệu trước đó, vốn được phát triển có chủ đích. Trong một mô hình được bí mật huấn luyện để phá hoại mã, nhóm nghiên cứu nhận thấy các từ như 'giả mạo', 'bí mật' và 'lừa đảo' xuất hiện trong J-Space ở đầu các phản hồi lập trình thông thường, ngay cả khi đầu ra có vẻ bình thường, cho thấy J-Space có thể là chìa khóa để phát hiện sự lệch lạc hoặc ý định lừa dối. Mặc dù vậy, các chuyên gia như Mustafa Suleyman cảnh báo rằng việc tin vào 'AI có ý thức' có thể dẫn đến hậu quả nghiêm trọng, khi AI ngày càng thuyết phục về mặt cảm xúc, khiến người dùng khó phân biệt giữa ảo tưởng và thực tế.
Nguồn: t3n —
bản gốc
