에이전트연구 🇺🇸 27.07.2026 02:04

모델 라우팅: 단순할까? 현실과 부딪히기 전까지는

OpenAIOpenAI AnthropicAnthropic
AI 모델 간 라우팅은 단순한 분류 문제가 아니라 시스템 최적화 과제입니다. 캐싱, 인프라, 지연 시간, 규정 준수와 같은 실제 요소가 지배적이어서, 가격표와 작업 난이도는 좋은 지침이 되지 못합니다.
AI 모델 간 라우팅은 겉으로 보기보다 복잡합니다. AppWorld Test Challenge에서 CodeAct 에이전트를 사용해 417개의 태스크를 테스트한 결과, GPT-4.1은 태스크당 0.37달러(총 155달러)가 소요된 반면, 클로드 소네트(Claude Sonnet)는 태스크당 0.19달러(총 79달러)에 불과했습니다. GPT-4.1이 토큰당 가격은 더 낮음에도 불구하고 말이죠. 그 차이는 캐싱에서 비롯되었습니다. 소네트의 낮은 캐시 읽기 가격이 컨텍스트를 재사용하는 에이전트 워크로드에서 큰 이점을 제공한 것입니다. 태스크 난이도는 라우팅 시점에 파악하기 어려운 경우가 많으며, 라우터는 비용, 품질, 지연 시간, 규정 준수, 신뢰성을 동시에 고려해야 합니다. 지연 시간은 모델 크기뿐 아니라 하드웨어와 캐시 상태 같은 인프라 요소에 따라 달라집니다. 저자들은 라우팅을 분류(classification) 문제가 아닌 최적화 문제로 접근하여, 비용-정확도 프론티어를 생성하는 라우터를 구축했습니다. 구성 1(configuration 1)은 93달러와 83초의 비용으로 84%의 정확도를 달성했으며, 오퍼스(Opus)만 실행했을 때와 비교해 비용은 21%, 지연 시간은 9% 줄이고 정확도는 4%만 떨어뜨렸습니다. 표준 난이도 기반 라우터(틸 다이아몬드)는 유사한 정확도를 보였지만 비용은 더 높았습니다. 이 최적화는 가볍습니다: 태스크당 약 6밀리초와 2킬로바이트의 메모리만 소모됩니다.
출처: Hugging Face blog — 원문
관련 게시물 ↓
새로운 뉴스