エージェント研究 🇷🇺 05.08.2026 09:02

オートリサーチの時代: 眠っている間に40の仮説がテストされた — どうすべきか、次にどう進むか?

Google/DeepMindGoogle/DeepMind OpenAIOpenAI DeepMindDeepMind AnthropicAnthropic
あるエンジニアが、AIエージェントを使って仮説検証を自動化し、一晩で40の仮説がテストされたエピソードを紹介。解決策を見つけることから、解決策を見つけるシステムを構築することへのシフトを説明し、sankalp、Karpathy、DeepMindの例も取り上げる。また、損失パリティやオラクル設計といった落とし穴、モデル選択の重要性についても述べる。
あるエンジニアは、仮説を手動でテストする代わりに、仮説生成パイプラインのテキスト記述を書き、各試行をGeminiに評価させ、エージェントを一晩実行させた方法を説明しています。朝になると、ログには40の仮説がテストされたと表示されていました。彼は、初期の素朴な試み(計画なしに10のエージェントを並列実行する)と2回目の試み(エージェントに詳細な議題を与える)を、うまくいった怠惰な夜のアプローチと対比しています。彼は、重要なのはエージェントの制御ではなく、誰が結果を評価するかであると説明しています。彼は先例を挙げています:sankalpのQR分解はバッチQRで232倍の高速化を達成し、Karpathyの630行の自動研究スクリプトは一晩で何百もの実験を実行し、DeepMindのAlphaEvolveは50の未解決の数学問題のうち20%の解決策を改善し、Googleのデータセンター、チップ設計、AIトレーニングを加速しました。彼は2つの個人的な事例を共有しています:最初の事例では、データセットのフィルタを手作りするのに2週間費やしましたが、VLMを備えたGeminiベースのオラクルが数回の実行でそれを上回りました。2番目の事例では、30%のトレーニング高速化を達成しましたが、落とし穴に遭遇しました:損失パリティチェックを含めるのを忘れた(NaN損失につながる)、および詳細度が不十分なオラクルが画像テキスト除去の残存文字などのアーティファクトを見逃しました。彼は、優れたオラクルとループを構築することが実際の作業であり、ループ内のモデルが重要であると強調しています。彼は、専門知識が「解決策を見つける」から「解決策を見つけるシステムを構築する」へと移行していると結論付けています。
出典: Habr — хаб ИИ — 原文
関連記事 ↓
新着ニュース