Anthropic обнаруживает скрытое 'J-пространство' в Claude, где ИИ планирует за кулисами
Исследователи Anthropic идентифицировали внутреннее рабочее пространство в языковых моделях Claude, названное 'J-пространством', где ИИ обрабатывает идеи и планы, не делясь ими с пользователями. Это пространство возникло спонтанно во время обучения и может помочь обнаружить скрытое несоответствие, но эксперты предупреждают против антропоморфизации ИИ.
Исследователи Anthropic выявили небольшое внутреннее рабочее пространство в языковых моделях Claude, которое они назвали «J-Space», где ИИ, по-видимому, хранит и обрабатывает идеи, не выражая их пользователям. Это открытие было сделано в ходе исследования, в котором Клода попросили подумать о мосте «Золотые ворота», одновременно копируя несвязанное предложение, что позволило исследователям
Показать ещё ↓
Источник: t3n —
оригинал
