停止ボタンのない2160ラウンドのシミュレーション:MiroFish研究、第3部
DeepSeek
Anthropic
Google/DeepMind
OpenAI
MiroFish研究の最終部では、シミュレーションの実行時間が単純な規則、つまりラウンド数は日数×24に等しいという規則によって決まることが明らかになりました。これはモデルではなく、パイプラインのテンプレートによるものです。システムは、そのメモリアーキテクチャでは処理できない義務(例:2160ラウンド)を受け入れてしまいます。また、インターフェースには停止ボタンがなく、実行を停止するには隠されたAPIエンドポイントが必要です。
MiroFish研究シリーズの3番目の記事では、入力が正しい場合に何が起こるかを検証している。シミュレーションの長さは、ユーザーのクエリ内の「今後7日間」のようなフレーズによって設定され、システムが確認を求めることはない。期間を指定した6回の実行では、ラウンド数は正確に日数×24(168、336、2160ラウンド)となり、4つのモデルファミリーで記録された。静的コード検査により、メカニズムが確認された:設定ジェネレーターは、LLMにtotal_simulation_hours(24〜168時間)とminutes_per_round(30〜120、推奨60)を入力するよう促し、ランナーはtotal_rounds = total_hours * 60 / minutes_per_roundを計算する。推奨の60分では、ラウンド数は時間数に等しくなるため、90日は2160ラウンドになる。文書化された24〜168時間の範囲はプロンプト内の推奨に過ぎず、コードがその数を制限または検証することはない。システムは自身の責務を果たせず、エージェントのメモリは無制限に蓄積され、劣化やプロバイダーエラーを引き起こす。7エージェントの世界は約300ラウンドで劣化し、4エージェントの世界は約515ラウンドで劣化した一方、18〜19エージェントの世界では早期終了が必要だった。UIには停止ボタンがなく、コミュニティメンバーがフロントエンドのハンドラーは存在するがボタンに接続されていないことを発見し、プルリクエストを提出した。研究者は、意味のあるアクティビティが停止した後、90日間の実行をラウンド592で終了させるために、文書化されていないPOST /api/simulation/stopを使用しなければならなかった。研究では限界が指摘されている:ほとんどのセルはn=1であり、テストされたモデルファミリーは4つだけで、すべての崩壊がDeepSeekワールドで発生したため、モデルファミリーからの独立性は未検証のままである。
出典: Habr — хаб ML —
原文
