Science One Framework: 체인 오브 에비던스를 통한 검증 가능한 자율 연구 프레임워크
Google/DeepMind
Sakana AI
Google Research는 Science One Framework를 소개합니다. 이는 검증 가능한 증거 체인을 구축하여 환각(hallucination)을 제거하는 자율 연구 프로토타입으로, AI 생성 논문의 무결성을 평가하는 자동화 프로토콜인 CoE Audit을 포함합니다. 결과는 Science One이 벤치마크에서 인간 전문가 수준과 일치하거나 능가하면서 제로 환각 참조(zero phantom references)와 완전히 검증 가능한 점수를 달성함을 보여줍니다.
Google Research가 제안한 Science One 프레임워크는 환각 현상을 제거하기 위해 검증 가능한 증거 체인을 기본적으로 구축하는 자율 연구 프로토타입이며, CoE Audit은 AI 생성 논문의 무결성을 평가하는 자동화된 프로토콜입니다. 이 프레임워크는 연구 산출물의 모든 주장이 기록된 증거 체인(완전성)을 가지며, 각 체인이 주장을 진정으로 뒷받침(정확성)해야 한다는 새로운 검증 가능성 개념인 Chain-of-Evidence(CoE)에 기반합니다. Science One 프레임워크는 세 가지 주요 모듈(Idea Explorer, Problem Investigator, Solution Developer)을 통해 CoE를 구현합니다. CoE Audit은 네 가지 엄격한 무결성 검사(참조문헌 검증, 점수 검증, 코드 재현성, 방법-코드 일치성)를 적용합니다. ADRS 벤치마크의 75개 논문에 대한 평가에서 Science One은 기준선 환각률(최대 21%) 대비 0%의 가짜 참조문헌, 완벽한 점수 검증, 최고의 방법-코드 일치성을 달성했으며, 다섯 가지 ADRS 작업 모두에서 인간 전문가와 동등하거나 더 나은 성능을 보였습니다. 이 프레임워크는 MLE-Bench와 Parameter-Golf를 포함한 여섯 가지 외부 복잡 작업에서도 테스트되어 최첨단 결과를 달성했습니다.
출처: Google Research —
원문
