Descubrimiento del Espacio de Trabajo Global en Modelos de Lenguaje: El Caso de Claude
Anthropic
Investigadores de Anthropic han descubierto un conjunto específico de patrones neuronales internos en el modelo de lenguaje Claude — el espacio J — que desempeña el papel de un "espacio de trabajo" para el acceso consciente a los pensamientos. Este espacio no fue programado sino que surgió de forma natural durante el entrenamiento. El espacio J permite al modelo reportar sus representaciones internas, modularlas a demanda y usarlas para razonamiento interno, recordando la teoría del espacio de trabajo global en neurociencia.
En un artículo, Anthropic presenta evidencia de que en los modelos de lenguaje modernos, en particular Claude, se ha formado un pequeño conjunto de patrones neuronales internos, denominado espacio J. Estos patrones se descubrieron mediante el método de lente jacobiana (lente J), que identifica la actividad interna que aumenta la probabilidad de que se pronuncie una palabra específica en el futuro. El espacio J posee propiedades únicas: Claude puede informar sobre las representaciones contenidas en él, modularlas a pedido, utilizarlas para razonamientos internos de múltiples pasos, y aplicar de manera flexible la misma representación para diferentes tareas. Además, el espacio J no participa en la mayoría de los procesos automáticos, como el habla fluida o la gramática, y su desactivación no altera el funcionamiento básico del modelo, pero lo priva de funciones cognitivas de orden superior. Los experimentos mostraron que el espacio J tiene fuertes conexiones con el resto de la red neuronal, lo que le permite actuar como un "espacio de trabajo global", similar a la teoría del acceso consciente en neurobiología. Los investigadores señalan que estos hallazgos no indican que Claude sea consciente, pero proporcionan una herramienta práctica para observar sus pensamientos internos, como la detección de intentos de engaño u objetivos ocultos. El artículo se acompaña de una publicación científica, código abierto y una demostración interactiva.
Fuente: Habr — хаб ИИ —
original
