RisetKeamanan AI 🇩🇪 09.08.2026 12:02

Anthropic Mengidentifikasi 'Ruang Berpikir' Tersembunyi dalam Model AI Claude

AnthropicAnthropic MicrosoftMicrosoft
Para peneliti Anthropic telah mengidentifikasi area pemrosesan internal spontan dalam model bahasa Claude, yang dijuluki 'J-Space', di mana AI tampaknya menyimpan dan memproses ide tanpa mengungkapkannya kepada pengguna. Penemuan ini menimbulkan pertanyaan tentang seberapa mirip pemikiran AI dengan kognisi manusia dan implikasinya untuk mendeteksi niat tersembunyi AI.
Anthropic telah mengidentifikasi ruang kerja internal yang muncul secara spontan dalam model bahasanya, Claude, yang dinamakan 'J-Space' berdasarkan metode Jacobi yang digunakan untuk melacak proses tersebut. Dalam ruang ini, AI tampaknya merencanakan dan memproses ide secara terpisah dari 'rantai pemikiran' yang dibagikannya dengan pengguna, mirip dengan bagaimana manusia berpikir tentang satu hal sambil melakukan hal lain. Para peneliti mengamati Claude melakukan tugas-tugas mental seperti mendeteksi kesalahan kode dan mengidentifikasi gambar tanpa mengutarakan langkah-langkah tersebut secara verbal. Perilaku ini memiliki kemiripan dengan teori ruang kerja global Bernard Baars, meskipun arsitektur model bahasa secara fundamental berbeda dari otak manusia. Penemuan ini dapat membantu mengungkap niat tersembunyi atau keselarasan yang salah dalam model AI. Namun, para ahli memperingatkan agar tidak mengantropomorfisasi AI, karena kepala AI Microsoft, Mustafa Suleyman, memperingatkan bahwa mempercayai 'AI yang sadar' dapat memiliki konsekuensi yang serius. Makalah penelitian Anthropic menggunakan kata 'sadar' lebih dari 200 kali, dan perusahaan baru-baru ini memperkenalkan fitur 'bermimpi' di mana Claude memproses informasi di antara sesi.
Sumber: t3n — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru