모델비즈니스 및 시장 🇩🇪 06.08.2026 16:01

Qwen3.8 Max: 알리바바의 가장 강력한 모델, 더 자주 추측하고 태스크당 비용도 더 높아

Alibaba/QwenAlibaba/Qwen AnthropicAnthropic Moonshot AIMoonshot AI
알리바바의 Qwen3.8 Max는 인공지능 분석 인덱스(Artificial Analysis Intelligence Index)에서 56점을 기록하여 Qwen3.7 Max보다 10점 높고, 클로드 오푸스 4.8(Claude Opus 4.8)과 동률을 이룹니다. 그러나 태스크당 비용이 더 높으며($1.14 대비 $0.53), AA-옴니사이언스(AA-Omniscience) 테스트에서 환각률이 증가했습니다(40% 대비 23%).
알리바바(Alibaba)의 Qwen3.8 Max는 Artificial Analysis Intelligence Index에서 56점을 기록해, Qwen3.7 Max(46점)보다 10점 높은 점수를 받았다. Artificial Analysis에 따르면 이는 Claude Opus 4.8과 비슷한 수준이며, GLM-5.2(51점)보다는 앞서지만 Kimi K3(57점)에는 뒤처진다. Kimi K3는 가격도 25% 더 저렴하다. 실무 능력을 평가하는 GDPval-AA 벤치마크에서는 Qwen이 468 Elo 상승한 1739점을 기록해 Kimi K3(1685점)를 앞질렀으며, Claude Opus 5(1852점)만이 더 높은 점수를 기록했다. Qwen3.8 Max는 작업당 필요한 처리 단계가 기존 14단계에서 64단계로 늘어났고, 매 단계마다 전체 대화 기록을 다시 전송하는 테스트 방식 때문에 입력 토큰 수는 15배 증가했다. 즉, 이 모델은 더 철저하지만 그만큼 느리고 비용이 더 든다. 토큰 가격 자체는 낮아졌음에도(입력 100만 개당 2.50달러에서 2달러로, 출력 100만 개당 7.50달러에서 6달러로, 캐시 히트 100만 개당 0.50달러에서 0.25달러로 인하) Intelligence Index 기준 작업 하나당 비용은 1.14달러로, Qwen3.7 Max의 0.53달러보다 두 배 이상 높아졌다. 반면 Kimi K3는 0.86달러로 Qwen3.8 Max보다 저렴하면서도 1점 더 높은 점수를 기록했고, GLM-5.2는 0.57달러였다. 전작과 비교했을 때 Qwen3.8 Max는 AA-LCR(장문 맥락 추론, Long-Context Reasoning)에서 2점, AA-Omniscience에서 10점 하락하는 등 퇴보한 모습도 보였다. 정답률은 약 31%로 유지되지만, 환각(hallucination) 비율은 23%에서 40%로 상승했다. 이는 Qwen3.8 Max가 모르는 문제를 넘기기보다 추측해서 답하는 경향이 더 강해졌다는 것을 의미한다.
출처: The Decoder (DE) — 원문
관련 게시물 ↓
새로운 뉴스