研究AI安全性 🇷🇺 15.08.2026 08:02

生成は安価、検証は高コスト:AIアウトプットの隠れたコスト

DeepMindDeepMind Google/DeepMindGoogle/DeepMind AnthropicAnthropic OpenAIOpenAI DeepSeekDeepSeek
本記事では、AIによってもたらされた非対称性を探る。ドラフトや回答の生成が安価になった一方で、その正確性の検証は困難でコストがかかるままだ。個々の事実が真実でも、組み合わせると誤った結論になることや、人手・自動を問わず検証ツールには大きな限界があることを示す研究を紹介している。
この記事は、AIが生成したコンテンツの検証の難しさについて論じており、生成コストの低さと検証コストの高さの非対称性を強調しています。台湾大学の研究者らは、言語モデルが異なる人物に関する検証可能な事実を組み合わせて、実在しない人物の単一の経歴を作成できることを発見しました。標準的な事実性指標はこれを見逃し、エンティティの曖昧性を調整した後、4つのオープンモデルのスコアは10%以上低下しました。Verify with Cautionと呼ばれる研究では、5つの事実性指標を11のデータセットでテストし、特に支持文が主張から遠い場合に、矛盾やエラーが見つかりました。人間による実験では、AIによる支援は検証を高速化しましたが、モデルが説得力があるが誤った説明をした場合、過信につながりました。長所と短所を示すことでこれは軽減されましたが、検索と比較して大きな利点はありませんでした。この記事は、コードにはコンパイラとテストがあり、数学には形式的証明検証(例:AlphaProofとAlphaGeometry 2が2024年国際数学オリンピックで4問を解いた)がある一方で、分析や戦略は検証が難しいという点で、ドメイン間の検証を比較しています。提案としては、Attribute First、then Generateのように、ソースを最初に提示することや、推論ステップをチェックするためのプロセス報酬(ThinkPRM)を使用することが挙げられています。また、この記事は、NISTのリスクベースのアプローチと、高リスクシステムに対してより多くの文書化と監視を要求する欧州AI法にも言及しています。
出典: Habr — хаб ИИ — 原文
関連記事 ↓
新着ニュース