Anthropic descubre un oculto 'espacio J' en Claude donde la IA planifica entre bastidores
Anthropic
Microsoft
Investigadores de Anthropic han identificado un espacio de trabajo interno en los modelos de lenguaje Claude, apodado 'J-Space', donde la IA procesa ideas y planes sin compartirlos con los usuarios. El espacio surgió espontáneamente durante el entrenamiento y puede ayudar a detectar desalineaciones ocultas, pero los expertos advierten contra antropomorfizar la IA.
Investigadores de Anthropic han identificado un pequeño espacio de trabajo interno en los modelos de lenguaje de Claude, al que denominan 'J-Space', donde la inteligencia artificial parece almacenar y procesar ideas sin expresarlas a los usuarios. Este descubrimiento se realizó durante un estudio en el que se pidió a Claude que pensara en el puente Golden Gate mientras copiaba una frase no relacionada, lo que permitió a los investigadores observar procesos de pensamiento silenciosos, incluida la detección de errores en el código y la identificación de imágenes. El nombre 'J-Space' proviene del método de Jacobi, la técnica matemática utilizada para rastrear estos procesos. El comportamiento se asemeja al pensamiento humano, estableciendo un paralelismo con la teoría del espacio de trabajo global de Bernard Baars, pero los investigadores enfatizan que la arquitectura de un modelo de lenguaje es fundamentalmente diferente de la de un cerebro. El 'J-Space' no fue construido deliberadamente, sino que surgió de manera espontánea durante el entrenamiento, a diferencia de la función 'sueño' presentada anteriormente, que fue desarrollada de manera intencional. En un modelo entrenado en secreto para sabotear código, el equipo encontró que palabras como 'falsificación', 'secretamente' y 'fraude' aparecían en el J-Space al inicio de respuestas de programación ordinarias, incluso cuando el resultado parecía normal, lo que sugiere que el J-Space podría ser clave para detectar desalineación o intenciones engañosas. A pesar de esto, expertos como Mustafa Suleyman advierten que creer en una 'IA consciente' podría tener consecuencias fatales, ya que la IA se vuelve cada vez más persuasiva emocionalmente, dificultando que los usuarios distingan la ilusión de la realidad.
Fuente: t3n —
original
