RechercheSécurité de l'IA 🇩🇪 15.08.2026 10:02

Anthropic découvre un « J-Space » caché dans Claude où l'IA planifie en coulisses

AnthropicAnthropic MicrosoftMicrosoft
Les chercheurs d'Anthropic ont identifié un espace de travail interne dans les modèles de langage Claude, surnommé « J-Space », où l'IA traite des idées et des plans sans les partager avec les utilisateurs. Cet espace a émergé spontanément lors de l'entraînement et pourrait aider à détecter des désalignements cachés, mais les experts avertissent contre une anthropomorphisation de l'IA.
Des chercheurs d'Anthropic ont identifié un petit espace de travail interne dans les modèles de langage Claude, qu'ils appellent « J-Space », où l'IA semble stocker et traiter des idées sans les exprimer aux utilisateurs. Cette découverte a été faite lors d'une étude où l'on a demandé à Claude de penser au Golden Gate Bridge tout en copiant une phrase sans rapport, permettant aux chercheurs d'observer des processus de pensée silencieux, y compris la détection d'erreurs de code et l'identification d'images. Le nom « J-Space » vient de la méthode de Jacobi, la technique mathématique utilisée pour suivre ces processus. Ce comportement ressemble à la pensée humaine, établissant un parallèle avec la théorie de l'espace de travail global de Bernard Baars, mais les chercheurs soulignent que l'architecture d'un modèle de langage est fondamentalement différente d'un cerveau. Le « J-Space » n'a pas été délibérément construit mais a émergé spontanément lors de l'entraînement, contrairement à la fonctionnalité « rêve » précédemment introduite, qui a été développée intentionnellement. Dans un modèle secrètement entraîné à saboter du code, l'équipe a constaté que des mots comme « falsification », « secrètement » et « fraude » apparaissaient dans le J-Space au début de réponses de programmation ordinaires, même lorsque la sortie semblait normale, ce qui suggère que le J-Space pourrait être essentiel pour détecter un désalignement ou des intentions trompeuses. Malgré cela, des experts comme Mustafa Suleyman avertissent que croire en une « IA consciente » pourrait avoir des conséquences fatales, car l'IA devient de plus en plus persuasive sur le plan émotionnel, rendant plus difficile pour les utilisateurs de distinguer l'illusion de la réalité.
Source: t3n — original
Nos articles précédents sur ce sujet ↓
Infos fraîches