모델미디어 생성 🇨🇳 07.08.2026 05:02

반지의 제왕을 보여줘! 카파시, LLM용 새 벤치마크 선보여

AnthropicAnthropic DeepSeekDeepSeek Moonshot AIMoonshot AI OpenAIOpenAI xAIxAI Google/DeepMindGoogle/DeepMind ElevenLabsElevenLabs
안드레이 카파시가 Anthropic의 Opus 5를 '반지의 제왕' 서문을 Three.js로 구현하여 중간계 세계를 생성하는 방식으로 테스트하고 있다고 발표했습니다. 이 벤치마크는 인기 있는 '펠리컨이 자전거를 타는' SVG 테스트를 대체하며, 복잡한 프로젝트 계획 및 지속적인 코딩 능력을 평가하는 것을 목표로 합니다. 결과로 생성된 3D 세계는 조잡하지만, 현재 LLM이 여전히 비디오를 실제로 이해하거나 자신이 만든 작품을 플레이할 수 없음을 보여줍니다.
안드레이 카파시는 Anthropic이 LLM을 위한 새로운 벤치마크를 사용하고 있다고 공개했습니다: 반지의 제왕 서문에서 중간계 세계를 생성하는 것입니다. 모델인 Claude Opus 5는 텍스트와 JavaScript 라이브러리인 Three.js를 프롬프트로 제공받아 브라우저에서 대화형 3D 장면을 만들도록 요청받았습니다. Opus 5는 데모를 만드는 데 100만 토큰, 2시간, 5500줄의 코드가 필요했습니다. 최종 결과는 초기 3D 애니메이션을 연상시킬 만큼 조잡했으며, 캐릭터가 공중에 떠 있거나 신체 부위가 분리되는 등의 문제가 있었습니다. 카파시는 Opus 5가 생성된 세계에 실제로 '들어갈' 수 없고, 오류를 확인하기 위해 다른 시간대의 스크린샷만 찍을 수 있다는 점을 인정하며, 이는 현재 LLM의 약점을 강조한다고 말했습니다: 코드를 작성하고 장면을 구축할 수는 있지만, 자신이 만든 비디오를 보거나 게임을 플레이할 수는 없다는 것입니다. 개발자 사이먼 윌리슨이 대중화한 '자전거를 타는 펠리컨' SVG 테스트는 모델이 너무 잘하게 되어 단계적으로 폐지되고 있습니다. 새로운 벤치마크는 복잡한 프로젝트를 계획하고, 몇 시간 동안 작업하고, 수천 줄의 코드를 반복 개선하는 모델의 능력을 테스트하는 것을 목표로 합니다. 커뮤니티 반응은 다양했습니다: 어떤 이들은 새로운 방향을 칭찬했고, 다른 이들은 비용과 Three.js가 정말 일반 지능을 측정하는지 의문을 제기했습니다. 네티즌들은 AI가 생성한 칸예 웨스트 콘서트 같은 자신들의 프로젝트도 만들었으며, 카파시는 품질 향상을 위해 Seedance(비디오 렌더링)와 ElevenLabs(오디오) 같은 API를 통합할 것을 제안했습니다.
출처: QbitAI 量子位 — 원문
관련 게시물 ↓
새로운 뉴스