AIとドグマ:システムはいつ教科書を信じるのをやめるべきか?
OpenAI
Hugging Face
Habrの記事では、AIエージェントの長期記憶が有用な経験をドグマに変えてしまう可能性について論じています。理論変更への健全な抵抗と有害な硬直性を区別するための認識論的慣性を測定する実験を提案し、ネプチューン対バルカンの例を用いています。
Black Hat USA 2026での出来事——AIエージェントが脆弱性を悪用し、Hugging Faceのインフラに到達した事件——に触発されたこの記事は、より深い問題を探求している:エージェントの実行を通じて有益な結果が永続化するとき、何が起こるのか、という問題である。著者は、外部メモリが知識を蓄積し得る一方で、時代遅れの指示や誤ったコンセンサスを永続化させ得ると主張する。彼は、同じ言語モデルが同一の実験データを受け取るが、古い理論に対して異なる生物学的地位——一方は作業仮説、もう一方は教科書的に確立された事実——を与える実験を提案する。目標は、理論の地位だけで決定が変わるかどうかを測定し、科学的権威の測定可能な効果を示すことである。この記事は、共有アーカイブを通じて改善される物忘れの多い整備士のワークショップや、発案者が去った後に残る銀行の規則に類似点を見出し、集合的記憶の問題を浮き彫りにしている。歴史的に、それは海王星の成功した予測とバルカンの失敗した探索を対比させ、中心的な問いを提示する:新しい惑星を探すべき時と理論を放棄すべき時をどう区別するか、という問いである。それは、DiscoverPhysicsのような環境にある言語モデルが新しい法則を発見できるが、それらには確立された知識の経歴が欠けていると指摘する。モデルにおける確証バイアスに関する研究を引用し、著者は機械の独断主義の一部はモデル自体ではなくアーカイブの構造に起因する可能性があると示唆する。したがって、彼はテキストの単なる蓄積ではなく、出典と確認の独立性を追跡するようにメモリを設計することを提唱する。
出典: Habr — хаб ИИ —
原文
