Finam AI Lab, LLM 금융 벤치마크 FINESSE-Bench 업데이트
Anthropic
Moonshot AI
Google/DeepMind
MiniMax
OpenAI
Meta
DeepSeek
Mistral
Сбер
Яндекс
Т-Банк
Finam의 인공지능 연구소가 금융 벤치마크 FINESSE-Bench의 업데이트 버전을 발표했습니다. 새로운 버전은 기술적 분석 데이터셋 CFTe-like Level 1을 추가하고, 169개의 CFA-like Level 1 문제를 수정했으며, 부트스트래핑으로 메트릭 계산을 개선하고 비교 테이블의 모델 풀을 33개로 확장했습니다.
Finam 인공지능 연구소(FIAM Artificial Intelligence Lab)가 금융 도메인에서 대규모 언어 모델(LLM)의 지식과 기술을 평가하기 위해 설계된 FINESSE-Bench 금융 벤치마크의 업데이트를 발표했습니다. 주요 변경 사항은 다음과 같습니다: CFA 수준 1과 유사한 데이터셋에서 169개의 문제 있는 질문을 수정; 기술적 분석의 기초에 관한 781개의 질문으로 구성된 CFTe 수준 1과 유사한 데이터셋을 새로 추가; 보다 강건한 모델 비교를 위해 부트스트래핑을 통한 신뢰 구간 계산으로 전환; 벤치마크 그룹별 결과 집계에 계층적 부트스트래핑 사용; 데이터셋의 변별력과 포화도(대부분의 FINESSE 질문이 중간 영역에 속해 좋은 진단 가치를 제공하는 것으로 나타남)를 별도 평가. 모델 풀도 확장되었습니다: 총 66개 시스템이 테스트되었으며, 이 중 49개는 11개 벤치마크(8개 FINESSE + 3개 공개) 전체를 포괄하고, 33개 모델이 주요 테이블에 포함되었습니다. 최고 결과는 GPT-5.5(시험 유사: 0.906, 거래/기술적 분석: 0.876), Claude Opus 4.8(시험 유사: 0.860, 거래/기술적 분석: 0.856) 등이 달성했습니다.
출처: Habr — хаб NLP —
원문
