Claude Fable 5, 처음부터 코드 재작성에서 GPT-5.6을 능가하다. 그 이유는
Anthropic
OpenAI
Epoch AI의 MirrorCode 벤치마크에서 Claude Fable 5가 64%의 작업을 해결한 반면, GPT-5.6 Sol은 20%에 그쳤습니다. 이러한 격차는 원시 능력보다는 신뢰성에서 비롯됩니다. Sol은 종종 작업을 부분적으로 해결하는 반면, Fable은 일관되게 완료합니다. 훈련 데이터가 부족한 언어인 Ada에서 Fable의 강력한 성능은 암기가 아닌 기술을 시사합니다.
Epoch AI가 MirrorCode 리더보드를 업데이트하여, Anthropic의 Claude Fable 5가 작업의 64%를 해결한 반면 OpenAI의 GPT-5.6 Sol은 20%만 해결한 것으로 나타났습니다. 모델들이 다른 테스트에서는 비슷한 성능을 보이기 때문에 이 3배 차이는 이상해 보이지만, Epoch AI와 Anthropic은 공식적인 설명을 제공하지 않았습니다. METR과 함께 개발된 MirrorCode는 모델이 실행 가능한 '블랙박스', 문서, 그리고 보이는 테스트만 보고 전체 프로그램을 처음부터 다시 작성해야 하며, 솔루션은 모든 숨겨진 테스트를 통과해야 합니다. 벤치마크에는 sed와 Ruff와 같은 15개의 실제 프로그램이 포함되어 있으며, 각각 두 언어로 구현되고, 시도당 100억 토큰과 7일의 예산이 주어집니다. 히트맵 분석에 따르면 Sol은 종종 작업을 부분적으로 해결하지만(성공률 50%, 33%, 17%), Fable은 거의 항상 완료합니다(100%, 83%). 또 다른 단서: Fable의 성능은 Ada에서 약간만 하락하는 반면(Go에서 64% 대 61%), OpenAI 모델은 Ada에서 크게 하락합니다. Sol은 24%에서 19%로, GPT-5.4는 21%에서 12%로, GPT-5.5는 17%에서 5%로 떨어집니다. 훈련 데이터에 이러한 프로그램의 Ada 구현이 거의 없기 때문에 Fable의 Ada 회복력은 암기가 아닌 진정한 기술을 나타냅니다. 그러나 Epoch 자체의 오염 검사에서는 25개 프로그램 중 17개에서 암기 징후를 발견했으며, 벤치마크의 정확한 사양 설정은 실제 개발 환경과 다릅니다.
출처: Habr — хаб ИИ —
원문
