Anthropic ontdekt verborgen 'denkruimte' in Claude AI-modellen
Anthropic
Microsoft
Onderzoekers van Anthropic hebben een spontaan intern verwerkingsgebied in Claude-taalmodellen geïdentificeerd, genaamd 'J-Space', waar de AI ideeën lijkt op te slaan en te verwerken zonder deze aan gebruikers te verbaliseren. Deze ontdekking roept vragen op over hoe nauw AI-denken lijkt op menselijke cognitie en de implicaties ervan voor het detecteren van verborgen AI-intenties.
Anthropic heeft een spontaan ontstane interne werkruimte geïdentificeerd in zijn Claude-taalmodelen, genaamd 'J-Space', naar de Jacobi-methode die wordt gebruikt om deze processen te traceren. In deze ruimte lijkt de AI ideeën te plannen en te verwerken, los van de 'gedachteketen' die het met gebruikers deelt, vergelijkbaar met hoe mensen over het ene denken terwijl ze iets anders doen. Onderzoekers observeerden dat Claude mentale taken uitvoert, zoals het detecteren van codefouten en het identificeren van afbeeldingen, zonder deze stappen te verbaliseren. Dit gedrag vertoont parallellen met de globale werkruimte-theorie van Bernard Baars, hoewel de architectuur van taalmodelen fundamenteel verschilt van het menselijk brein. Deze ontdekking zou kunnen helpen bij het onthullen van verborgen intenties of misalignments in AI-modellen. Experts waarschuwen echter tegen het antropomorfiseren van AI, aangezien Mustafa Suleyman, AI-chef bij Microsoft, waarschuwde dat het geloven in 'bewuste AI' ernstige gevolgen zou kunnen hebben. Het onderzoekspaper van Anthropic gebruikt het woord 'bewust' meer dan 200 keer, en het bedrijf introduceerde onlangs een 'dagdroom'-functie waarbij Claude informatie verwerkt tussen sessies door.
Bron: t3n —
origineel
