Science One Framework : un cadre de recherche autonome vérifiable via la chaîne de preuve
Google/DeepMind
Sakana AI
Google Research présente le Science One Framework, un prototype de recherche autonome qui élimine les hallucinations en construisant des chaînes de preuve vérifiables, ainsi que le CoE Audit, un protocole automatisé pour évaluer l'intégrité des articles générés par l'IA. Les résultats montrent que Science One atteint zéro référence fantôme et des scores entièrement vérifiables tout en égalant ou surpassant les performances d'experts humains sur des benchmarks.
Google Research a dévoilé le cadre Science One, un prototype de recherche autonome conçu pour éliminer les hallucinations en construisant de manière native des chaînes de preuves vérifiables, ainsi que l'audit CoE, un protocole automatisé pour évaluer l'intégrité des articles générés par l'intelligence artificielle. Le cadre repose sur la chaîne de preuves (Chain-of-Evidence, CoE), un nouveau concept de vérifiabilité qui exige que chaque affirmation dans un artefact de recherche possède une chaîne de preuves enregistrée (complétude) et que chaque chaîne soutienne réellement l'affirmation (exactitude). Le cadre Science One instancie le CoE via trois modules principaux : un explorateur d'idées, un investigateur de problèmes et un développeur de solutions. L'audit CoE applique quatre contrôles stricts d'intégrité : vérification des références, vérification des scores, reproductibilité du code et alignement méthode-code. Dans les évaluations sur 75 articles du benchmark ADRS, Science One a atteint zéro référence fantôme par rapport à des taux d'hallucination de base allant jusqu'à 21 %, une vérification parfaite des scores et le meilleur alignement méthode-code, tout en égalant ou dépassant les performances d'experts humains sur l'ensemble des cinq tâches ADRS. Le cadre a également été testé sur six tâches externes complexes, dont MLE-Bench et Parameter-Golf, obtenant des résultats de pointe.
Source: Google Research —
original
