에이전트모델 🇷🇺 05.08.2026 13:03

1달러짜리 에이전트: Hermes Agent와 DeepSeek V4 Flash 조합의 경제학

DeepSeekDeepSeek
바이럴 스크린샷은 오픈소스 Hermes Agent와 DeepSeek V4 Flash를 사용하여 1달러 약간 넘는 비용으로 수억 개의 토큰을 처리했다고 주장했습니다. 이 소식은 자동 프리픽스 캐싱에 초점을 맞춰 그러한 저비용의 메커니즘을 설명하고, 캐시를 깨뜨리는 요인과 공급업체의 주장을 설명합니다.
8월 초, X에서 수억 개의 처리된 토큰과 1달러가 조금 넘는 청구서를 보여주는 대시보드 스크린샷이 유포되었는데, 이는 오픈 Hermes Agent를 DeepSeek V4 Flash 모델에 사용한 것으로 알려졌습니다. Nous Research가 MIT 라이선스로 개발한 Hermes Agent는 모든 OpenAI 호환 엔드포인트에서 작동하며, 학습된 기술을 마크다운 파일에 저장하는 폐쇄형 학습 루프를 특징으로 합니다. 7월 31일부터 공개 베타 버전인 DeepSeek V4 Flash는 4월 프리뷰와 동일한 아키텍처를 사용하지만, 파인튜닝 후 에이전트 기능이 개선되었습니다. 주요 비용 절감 효과는 낮은 기본 요금이 아니라 자동 접두사 캐싱에서 발생합니다. 반복되는 프롬프트 접두사는 수십 배 낮은 요율로 청구됩니다. 에이전트 루프는 이 메커니즘에 거의 완벽하게 부합하는데, 각 호출이 동일한 시스템 프롬프트와 기록을 몇 줄만 추가하여 다시 전송하기 때문입니다. 그러나 프롬프트 헤더의 요소(예: 타임스탬프, 세션 식별자, 동적으로 재정렬된 도구 목록)가 변경되면 절감 효과가 사라집니다. 공급업체는 더 작은 모델이 에이전트 벤치마크에서 더 큰 프리뷰 모델을 능가한다고 주장하지만, 복잡한 추론에는 V4-Pro를 사용할 것을 권장합니다. 피크 시간대 추가 요금이 발표되었지만 아직 적용되지는 않았으며, Pro로의 에스컬레이션이 포함된 하이브리드 라우팅은 캐시를 재설정합니다. 이 기사는 가격 요금을 제공하고, 일반적인 캐시 중단 요소를 나열하며, 속도 제한 및 보안 경계와 같은 운영 고려 사항과 계획에 대한 조언을 제공합니다.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스