연구에이전트 🇺🇸 31.07.2026 00:02

Science One 프레임워크: 증명 체인을 통한 검증 가능한 자율 연구 프레임워크

Google/DeepMindGoogle/DeepMind Sakana AISakana AI
구글 리서치(Google Research)는 Science One 프레임워크를 선보였습니다. 이 자율 연구 프로토타입은 검증 가능한 증명 체인을 구축하여 환각(hallucination)을 제거하며, AI 생성 논문의 무결성을 평가하는 자동화 프로토콜인 CoE Audit도 함께 발표했습니다. 실험 결과, Science One은 벤치마크에서 인간 전문가 수준의 성능을 일치시키거나 능가하면서도 가짜 참고문헌이 전혀 없고 완전히 검증 가능한 점수를 달성했습니다.
Google Research가 제안한 Science One 프레임워크는 환각 현상을 제거하기 위해 검증 가능한 증거 체인을 기본적으로 구축하는 자율 연구 프로토타입이며, CoE Audit은 AI 생성 논문의 무결성을 평가하는 자동화된 프로토콜입니다. 이 프레임워크는 연구 산출물의 모든 주장이 기록된 증거 체인(완전성)을 가지며, 각 체인이 주장을 진정으로 뒷받침(정확성)해야 한다는 새로운 검증 가능성 개념인 Chain-of-Evidence(CoE)에 기반합니다. Science One 프레임워크는 세 가지 주요 모듈(Idea Explorer, Problem Investigator, Solution Developer)을 통해 CoE를 구현합니다. CoE Audit은 네 가지 엄격한 무결성 검사(참조문헌 검증, 점수 검증, 코드 재현성, 방법-코드 일치성)를 적용합니다. ADRS 벤치마크의 75개 논문에 대한 평가에서 Science One은 기준선 환각률(최대 21%) 대비 0%의 가짜 참조문헌, 완벽한 점수 검증, 최고의 방법-코드 일치성을 달성했으며, 다섯 가지 ADRS 작업 모두에서 인간 전문가와 동등하거나 더 나은 성능을 보였습니다. 이 프레임워크는 MLE-Bench와 Parameter-Golf를 포함한 여섯 가지 외부 복잡 작업에서도 테스트되어 최첨단 결과를 달성했습니다.
출처: Google Research — 원문
관련 게시물 ↓
새로운 뉴스