모델연구 🇷🇺 13.08.2026 22:02

GPT-5.6 Luna보다 11배 저렴한 초소형 AI 모델, 논리 테스트에서 거의 동급 성능

OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind Alibaba/QwenAlibaba/Qwen
Pathway Lab이 자사의 추론 모델 BDH-CQ에 대한 테스트 결과를 발표했습니다. 1억 5천만 개의 파라미터를 가진 이 모델은 ARC-AGI-1 벤치마크에서 29.5%의 점수를 기록했습니다. 계산 비용은 작업당 0.0007달러로, 작업당 0.008달러의 비용으로 34.2%를 기록한 OpenAI의 GPT-5.6 Luna보다 11배 저렴합니다. 이 연구소는 대안적 아키텍처가 비용 효율성을 대폭 개선할 수 있다고 주장합니다.
Pathway Lab은 트랜스포머와 다른 아키텍처에 초점을 맞춘 연구소로, 추론 모델 BDH-CQ의 결과를 발표했습니다. 이 모델은 파라미터가 1억 5천만 개에 불과함에도 불구하고 ARC-AGI-1 벤치마크에서 29.5%를 달성했으며, 작업당 비용은 단 0.0007달러에 불과합니다. 이는 OpenAI의 소형 모델인 GPT-5.6 Luna보다 11배 저렴한 것으로, GPT-5.6 Luna는 80% 가격 인하 후에도 34.2%의 점수를 기록하며 작업당 0.008달러의 비용이 들었습니다. 비교를 위해, Anthropic Claude Opus 5와 Google Gemini 3.1 Pro는 동일한 테스트에서 97~98%의 점수를 기록했지만 작업당 0.5~0.6달러의 비용이 들어 거의 천 배 더 비쌌습니다. Alibaba Qwen3 235B는 BDH-CQ보다 세 배 이상의 비용이 들었지만 성능은 더 낮았습니다. 연구소는 이러한 차이가 추론 메커니즘에서 비롯된다고 설명합니다. 현재 대부분의 AI 모델은 토큰을 소비하는 중간 텍스트를 생성하는 반면, BDH-CQ는 메모리에서 조용히 문제를 해결합니다. 초기 실험에 따르면 BDH-CQ는 1억에서 6000억 개의 파라미터를 가진 트랜스포머 모델과 유사한 표준 스케일링 법칙을 따릅니다. Pathway는 수학적 추론, ARC-AGI-2 테스트, 그리고 궁극적으로 ARC-AGI-3의 전체 평가를 포함한 더 어려운 작업을 해결할 계획이며, 이러한 효율성 이점이 더 크고 복잡한 문제에서도 유지되기를 기대하고 있습니다.
출처: 3DNews — 원문
관련 게시물 ↓
새로운 뉴스