InvestigaciónSeguridad de IA 🇩🇪 09.08.2026 12:02

Anthropic Identifica un 'Espacio de Pensamiento' Oculto en los Modelos de IA Claude

AnthropicAnthropic MicrosoftMicrosoft
Investigadores de Anthropic han identificado un área de procesamiento interno espontánea en los modelos de lenguaje Claude, denominada 'J-Space', donde la IA parece almacenar y procesar ideas sin verbalizarlas a los usuarios. Este descubrimiento plantea preguntas sobre cuán cerca está el pensamiento de la IA de la cognición humana y sus implicaciones para detectar intenciones ocultas de la IA.
Anthropic ha identificado un espacio de trabajo interno que ha surgido espontáneamente en sus modelos de lenguaje Claude, denominado 'J-Space' en honor al método de Jacobi utilizado para rastrear estos procesos. En este espacio, la IA parece planificar y procesar ideas por separado de la 'cadena de pensamiento' que comparte con los usuarios, de manera similar a cómo los humanos piensan en una cosa mientras hacen otra. Los investigadores observaron a Claude realizando tareas mentales como detectar errores de código e identificar imágenes sin verbalizar estos pasos. Este comportamiento guarda paralelismos con la teoría del espacio de trabajo global de Bernard Baars, aunque la arquitectura de los modelos de lenguaje difiere fundamentalmente del cerebro humano. El descubrimiento podría ayudar a revelar intenciones ocultas o desalineaciones en los modelos de IA. Sin embargo, los expertos advierten contra la antropomorfización de la IA, ya que el jefe de IA de Microsoft, Mustafa Suleyman, advirtió que creer en una 'IA consciente' podría tener consecuencias graves. El artículo de investigación de Anthropic utiliza la palabra 'consciente' más de 200 veces, y la compañía recientemente introdujo una función de 'sueño' en la que Claude procesa información entre sesiones.
Fuente: t3n — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas