에이전트하드웨어 및 추론 🇷🇺 05.08.2026 17:02

에이전틱 개발에서 진짜 선두는 누구? 생각과는 다릅니다

AnthropicAnthropic DeepSeekDeepSeek OpenAIOpenAI Google/DeepMindGoogle/DeepMind Alibaba/QwenAlibaba/Qwen
한 개발자가 거버넌스 스택 하에서 에이전틱 코딩을 사용한 2주간의 프로덕션 실험에서 30,993건의 요청을 통해 총 88억 개의 토큰을 소비했습니다. 비용 분석 결과, Anthropic의 모델과 DeepSeek 간 가격 격차가 72배에 달하며, 이는 93% KV-캐시 압축 기술에 의해 주도됩니다. 거버넌스를 저렴하게 유지할 수 있는 것은 오직 DeepSeek의 아키텍처 덕분입니다.
기사에 따르면, 2026년 6월 진행된 2주간의 실제 운영 실험에서 한 개발자가 거버넌스 스택을 갖춘 에이전틱 코딩 도구를 사용한 결과, 총 88억 2천만 개의 토큰이 3만 993건의 요청에서 소비되었으며 캐시 적중률은 99.38%에 달했다. 정책, 스킬, 리뷰 프롬프트 등 거버넌스에 따른 컨텍스트 오버헤드는 호출당 7만~9만 토큰 수준이었다. 비용은 모델에 따라 극명하게 갈렸다. 앤트로픽(Anthropic)의 Sonnet 4.6을 사용할 경우, 현실적인 92% 캐시 적중률을 가정해도 동일한 작업량에 4,770달러가 소요되는 반면, DeepSeek V4 Pro는 단 66.17달러에 그쳐 72배에 달하는 차이가 발생했다. 이 격차는 DeepSeek의 멀티헤드 잠재 어텐션(Multi-Head Latent Attention, MLA) 방식에서 비롯된다. 이 기술은 KV-캐시(키-값 캐시)를 93.3% 압축해 캐시 읽기를 거의 무료 수준으로 만들고, 3FS를 통해 범용 SSD에서도 캐시를 며칠간 유지할 수 있게 한다. 반면 앤트로픽, 오픈AI(OpenAI), 구글(Google)은 GQA/MHA(그룹 쿼리 어텐션/멀티헤드 어텐션) 방식을 사용하는데, 이 경우 HBM(고대역폭 메모리)의 한계로 인해 캐시가 한 시간 이내에 만료된다. 기사는 또한 우버(Uber), 마이크로소프트(Microsoft), 아마존(Amazon), 핀터레스트(Pinterest) 및 이름이 밝혀지지 않은 한 기업에서 발생한 사례들을 인용하며, 통제되지 않은 에이전트 사용으로 인해 비용이 폭증한 사례를 보여준다. 기사는 DeepSeek의 아키텍처적 선택이 거버넌스를 경제적으로 실현 가능하게 만든 반면, 더 비싼 대안들은 팀들로 하여금 안전장치를 포기하게 만든다고 주장한다.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스