研究エージェント 🇺🇸 31.07.2026 00:02

Science One Framework: チェーン・オブ・エビデンスによる検証可能な自律研究フレームワーク

Google/DeepMindGoogle/DeepMind Sakana AISakana AI
Google Researchは、ハルシネーションを排除する検証可能なエビデンスチェーンを構築する自律研究プロトタイプ「Science One Framework」と、AI生成論文の完全性を評価する自動プロトコル「CoE Audit」を発表。Science Oneは、ベンチマークで人間の専門家のパフォーマンスに匹敵またはそれを上回りながら、幻影参照をゼロにし、完全に検証可能なスコアを達成した。
Google Researchは、幻覚を排除するために証拠連鎖をネイティブに構築する自律研究プロトタイプ「Science One Framework」と、AI生成論文の整合性を評価する自動プロトコル「CoE Audit」を発表しました。このフレームワークは、新しい検証可能性の概念であるChain-of-Evidence(CoE)に基づいており、研究アーティファクト内のすべての主張が記録された証拠連鎖を持つこと(完全性)と、各連鎖が主張を真に支持すること(正確性)を要求します。Science One Frameworkは、Idea Explorer、Problem Investigator、Solution Developerの3つの主要モジュールを通じてCoEを具現化します。CoE Auditでは、参照検証、スコア検証、コード再現性、方法とコードの整合性という4つの厳格な整合性チェックを適用します。ADRSベンチマークの75の論文に対する評価では、Science Oneは最大21%のベースライン幻覚率に対して幻覚参照をゼロにし、スコア検証は完璧、方法とコードの整合性は最高を達成し、5つのADRSタスクすべてで人間の専門家のパフォーマンスと同等かそれを上回りました。また、MLE-BenchやParameter-Golfを含む6つの外部複合タスクでもテストされ、最先端の結果を達成しました。
出典: Google Research — 原文
関連記事 ↓
新着ニュース