에이전트 🇷🇺 30.07.2026 17:01

왜 AI 에이전트가 실제로 RAG보다 더 저렴한가

비록 고전적인 RAG 어시스턴트가 쿼리당 비용이 더 저렴해 보이지만, 사용자 후속 질문과 운영자 에스컬레이션과 같은 숨겨진 비용으로 인해 전체적으로 더 비쌉니다. ReAct 루프를 사용하는 에이전트는 완전한 답변을 찾을 때까지 여러 문서를 자율적으로 검색하여, 3회 시도에 27분이 걸리던 과정을 단일 4분 답변으로 전환합니다. 지원 프로젝트의 실제 파일럿 데이터는 에이전트가 RAG 어시스턴트 비용의 3분의 1로 질문을 마감함을 확인합니다.
이 글은 RAG 어시스턴트와 에이전트 간의 단순한 비용 비교가 오해의 소지가 있다고 주장합니다. 전통적인 RAG 어시스턴트는 LLM 호출을 한 번 수행하고, 답변이 틀리면 사용자가 직접 쿼리를 수정하도록 의존합니다. 실제로 사용자는 보통 2~3회 시도 후 포기하고, 문제를 해결하기 위해 10~15분을 소비하는 인간 상담원에게 에스컬레이션합니다. 이는 단일 LLM 호출보다 훨씬 더 많은 비용을 초래합니다. ReAct 루프 기반의 에이전트는 사용자 개입 없이 검색 도구를 자율적으로 반복 사용하며, 가설을 세우고, 청크를 검색하고, 최종 답변을 종합합니다. 저자의 ISTOK 에이전트는 다섯 가지 도구를 사용합니다: VectorSearch(Milvus를 통한 하이브리드 Dense+BM25), Search(PostgreSQL 전문 검색), OpenChunk(전체 문서 청크 읽기), GetDocumentChunks(목차용), 그리고 CallOperator(자체 시도 2~3회 후 최후 수단). 컨텍스트 윈도우 제한을 관리하기 위해 에이전트는 처음에는 LLM 요약을 시도했지만 비용이 많이 들고 신뢰성이 낮아 현재는 슬라이딩 윈도우(최근 6개 메시지 유지, 가장 오래된 도구 메시지 제거)를 사용하고, 요약은 최대 세션당 2회의 대체 수단으로 사용합니다. LLM 호출도 차별화됩니다: 저렴한 임베딩 및 재순위화, 간단한 단계를 위한 가벼운 생성, 일반적인 추론을 위한 중간, 최종 합성 또는 요약을 위한 고비용 전용. 약 1,200개의 문서와 월 1,800건의 요청이 있는 실제 파일럿에서 어시스턴트는 평균 LLM 호출 1회, 사용자 후속 조치 2.3회, 에스컬레이션율 34%, 종결 시간 27분, 종결된 질문당 약 18,000토큰을 기록했습니다. 에이전트는 평균 LLM 호출 6.4회, 후속 조치 0.3회, 에스컬레이션율 11%, 종결 시간 4분, 약 15,500토큰을 기록했습니다. 직접 비용 측면에서 어시스턴트의 종결 질문당 비용은 약 52루블(상담원 비용 포함)인 반면, 에이전트는 약 17루블로 3배 절감되었습니다. 단순한 사실 질문이나 지식 베이스가 비어 있는 경우 에이전트의 이점은 사라지며, 불필요한 반복이 발생합니다. 에이전트는 모든 호출의 토큰 사용량과 도구 기록을 로깅하며, Arize Phoenix를 통해 세부 반복 분석을 추적합니다.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스