연구모델 🇷🇺 27.07.2026 03:03

QuantCode-Bench: 대규모 언어 모델의 실행 가능한 알고리즘 트레이딩 전략 생성 능력을 평가하는 새로운 벤치마크

OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind xAIxAI DeepSeekDeepSeek Alibaba/QwenAlibaba/Qwen Moonshot AIMoonshot AI
연구진은 대규모 언어 모델(LLM)이 텍스트 사양으로부터 실행 가능한 알고리즘 트레이딩 전략을 얼마나 잘 생성할 수 있는지 평가하기 위해 QuantCode-Bench를 개발했습니다. 이 벤치마크는 컴파일, 백테스트, 거래 생성, 판정 검증의 네 단계를 통해 코드 정확성뿐만 아니라 원래 트레이딩 아이디어와의 의미적 일치도 평가합니다.
QuantCode-Bench는 자연어 설명으로부터 실행 가능한 알고리즘 트레이딩 전략을 생성하는 LLM의 능력을 평가하기 위해 설계된 벤치마크입니다. Reddit, TradingView, StackExchange, GitHub 및 합성 데이터에서 수집된 400개의 태스크를 포함하며, 세 가지 난이도 수준을 다룹니다. 평가 파이프라인은 컴파일(구문 검사), 백테스트(런타임 실행), 트레이드(최소 하나의 거래 실행), 그리고 판사(LLM 판사에 의한 의미론적 정렬)의 네 단계로 구성됩니다. 단일 턴(원샷 생성) 및 에이전트 기반 다중 턴(피드백을 통한 최대 10회 반복 개선)의 두 가지 모드가 지원됩니다. 결과에 따르면 거의 모든 강력한 모델이 단일 턴 모드에서 완벽한 컴파일을 달성했지만, 최종 판사 통과율은 크게 달라져 GPT-5.5가 82.5%로 선두를 차지했습니다. 다중 턴 모드에서는 성능이 극적으로 향상되어 GPT-5.5가 98.8%의 판사 통과율에 도달했습니다. 이 벤치마크는 구문적 정확성만으로는 도메인 특화 코드 생성에 충분하지 않으며, 모델이 트레이딩 도메인, API 의미론을 이해하고 모호한 설명을 구체화해야 함을 강조합니다.
출처: Habr — хаб NLP — 원문
관련 게시물 ↓
새로운 뉴스