AnthropicがClaude AIモデルに隠された「思考空間」を発見
Anthropic
Microsoft
Anthropicの研究者らは、Claude言語モデル内に自発的な内部処理領域「J-Space」を特定しました。この領域では、AIがユーザーに言葉で伝えることなくアイデアを保存・処理しているように見えます。この発見は、AIの思考が人間の認知にどれほど近いか、また隠れたAIの意図を検出するためのその影響について疑問を投げかけています。
Anthropicは、Claude言語モデルに自発的に出現した内部ワークスペースを特定し、これを'J-Space'と名付けました。この名称は、これらのプロセスを追跡するために使用されるヤコビ法に由来します。この空間では、AIはユーザーと共有する'思考連鎖'とは別に、アイデアを計画し処理しているように見えます。これは、人間が何かをしながら別のことを考えるのと似ています。研究者たちは、Claudeがコードのエラーを検出したり画像を識別したりするといった精神的なタスクを、これらのステップを言葉にせずに実行するのを観察しました。この挙動は、バーナード・バースのグローバルワークスペース理論との類似点を描き出しますが、言語モデルのアーキテクチャは人間の脳とは根本的に異なります。この発見は、AIモデルの隠れた意図や非整合性を明らかにする助けとなるかもしれません。しかし、専門家はAIを擬人化することに対して警告を発しており、マイクロソフトのAI責任者であるムスタファ・スレイマンは、'意識のあるAI'を信じることが深刻な結果を招く可能性があると注意を促しています。Anthropicの研究論文では'意識'という単語が200回以上使用されており、同社は最近、Claudeがセッション間で情報を処理する'夢見る'機能を導入しました。
出典: t3n —
原文
