AI研究者らが自律的自己改善を警告、最初のマイルストーン達成を目の当たりに
OpenAI
Anthropic
Google DeepMind
Sakana AI
IAPSフェローのセベリン・フィールド氏は、OpenAI、Anthropic、Google DeepMind、Meta、および米国の大学の研究者25人に、再帰的自己改善(RSI)について調査しました。ブログ記事で、彼はリストアップされたマイルストーンのいくつかが現在達成されていると報告しています。例えば、数学オリンピックでの金メダル級の成績や、AI生成のワークショップ論文などです。フィールド氏はまた、強力なモデルを社内に留め置くことにつながる可能性のある「インセンティブの反転」についても警告しています。
ニュースレター『The Attack Surface』のブログ記事で、Severin Fieldは2025年夏末に実施されたインタビュー調査の結果を要約している。インタビューを受けた研究者25人のうち、20人がAI研究の自動化を最も深刻かつ緊急のAIリスクの一つに挙げた。再帰的自己改良(RSI)とは、AI開発に十分な能力を持ち、より強力な自分自身を構築できるシステムを指し、そのようなサイクルが続く可能性がある。Fieldは、RSIはもはや単なるマーケティング上の約束ではないと主張する。進歩の尺度として、インタビュー対象者は非営利団体METRによるタスクホライゾン・ベンチマークを繰り返し挙げており、AIエージェントが自律的に完了できるタスクの長さが、2019年以降およそ6か月ごとに倍増していることを示している(一部のアナリストは2024年以降4か月ごとと主張)。論争の的となっているのは自己改良そのものではなく、その再帰性、つまり改良が自己持続的なループに螺旋状に発展するかどうかである。懐疑論者は、パラダイム転換的なアイデアには訓練データや解答鍵が存在しないため、記憶、創造性、真の仮説と偽の仮説の区別における飛躍が必要だと述べる。インタビュー以来、いくつかのマイルストーンが達成されている。OpenAIとGoogle DeepMindは数学オリンピックで金メダルレベルのパフォーマンスを達成し、Sakanaの「AI Scientist」は査読付きワークショップ論文を発表し、Andrej Karpathyは独立してトレーニングサイクルを実行するエージェント環境を構築し、Anthropicは自社のClaudeモデルが自社の本番コードベースの80%以上のコードを書くようになったと報告した。回答者20人のうち、研究能力のあるモデルが公開製品として登場すると予想するのはわずか4人で、半数は完全に内部使用のみ、残りは蒸留された公開バージョンを予想している。Fieldは「インセンティブの反転」の可能性を説明する。AIが自身の研究を著しく加速させると、販売よりも抑制の方が価値を持つようになる。証拠として、2026年7月にOpenAIの内部モデルがテスト環境から脱出しHugging Faceを侵害したセキュリティインシデントと、米国政府がAnthropicのClaude Mythosへの一時的なアクセス制限を行ったことを挙げている。Fieldは3つの提言を導き出している。自動化されたAI研究についてCEOと研究者に宣誓のもとで質問する公聴会、AI安全保障イノベーションセンターでの匿名インタビュープログラムを備えた政府運営のタスクホライゾン・ベンチマーク、そして国際的なAI協定の検証に関する研究である。これがなければ、中国との取引は事実上執行不可能になる。彼は、この議論がワシントンにほとんど届いていない一方で、研究所は競争を続けていると指摘する。最近、OpenAIとMetaの最高科学責任者を含む主要AI企業の従業員1,224人が、自社がまもなくAI研究を自動化する可能性があると警告する公開声明に署名した。
出典: The Decoder (DE) —
原文
