Science One Framework: Een verifieerbaar autonoom onderzoeksframework via Chain-of-Evidence
Google/DeepMind
Sakana AI
Google Research introduceert het Science One Framework, een autonoom onderzoeksprototype dat hallucinaties elimineert door verifieerbare bewijsketens op te bouwen, en de CoE Audit, een geautomatiseerd protocol om de integriteit van AI-gegenereerde papers te evalueren. Resultaten tonen aan dat Science One nul fantoomreferenties en volledig verifieerbare scores behaalt, terwijl het op benchmarks gelijk of beter presteert dan menselijke experts.
Google Research heeft het Science One Framework geïntroduceerd, een autonoom onderzoeksprototype dat is ontworpen om hallucinaties te elimineren door van nature verifieerbare bewijsketens op te bouwen, samen met de CoE Audit, een geautomatiseerd protocol om de integriteit van AI-gegenereerde papers te evalueren. Het raamwerk is gebaseerd op Chain-of-Evidence (CoE), een nieuw verifieerbaarheidsconcept dat vereist dat elke bewering in een onderzoeksartefact een geregistreerde bewijsketen heeft (volledigheid) en dat elke keten de bewering daadwerkelijk ondersteunt (correctheid). Het Science One Framework implementeert CoE via drie hoofdmodules: een Ideeënverkenner, een Probleemonderzoeker en een Oplossingsontwikkelaar. De CoE Audit past vier strikte integriteitscontroles toe: referentieverificatie, scoreverificatie, reproduceerbaarheid van code en methode-code-alignment. In evaluaties op 75 papers uit de ADRS-benchmark behaalde Science One nul fantoomreferenties vergeleken met baselinehallucinatiepercentages tot 21%, perfecte scoreverificatie en de hoogste methode-code-alignment, terwijl het op alle vijf ADRS-taken presteerde op of boven het niveau van menselijke experts. Het raamwerk werd ook getest op zes externe complexe taken, waaronder MLE-Bench en Parameter-Golf, met state-of-the-art resultaten.
Bron: Google Research —
origineel
