LLM-wiki 대 RAG: 기업 문서를 위한 답변 생성 방법 비교
OpenAI
Google DeepMind
Anthropic
저자는 합성 문서인 "Directive 401"을 사용하여 LLM-wiki(위키 에이전트 기반)와 단순한 RAG 시스템을 비교했습니다. 결과는 LLM-wiki가 답변 완전성(재현율)에서 지속적으로 RAG를 능가했으며, 정밀도 차이는 미미했습니다. 위키 구축 비용은 3.7달러 미만이었습니다.
저자는 문서 기반 답변을 생성하는 두 가지 접근법, 즉 LLM-wiki(Andrej Karpathy의 아이디어에서 영감을 받음)와 벡터 검색기를 사용한 간단한 RAG(Retrieval-Augmented Generation) 시스템을 비교하는 실험을 수행했습니다. 약 10만 자 분량의 합성 기업 문서 'Directive 401'이 gemma4:31b 모델에 의해 준비되었습니다. 질문(사실 기반 20개, 사례 기반 20개)은 gpt-5.1 모델로 합성되었습니다. 위키를 구축하기 위해 소스 문서를 25개 부분(24개 조항과 제목 페이지)으로 나눈 후, Obsidian에 AGENTS.md 파일을 추가하고 Claude Code(Sonnet 5)를 사용하여 20분 만에 32개의 위키 페이지를 생성했으며, 비용은 3.7달러 미만이었습니다. 위키 에이전트는 Navigator(gpt-4.1-mini), Linker(gpt-4.1-mini), Context Collector, Synthesizer(gpt-4.1)의 네 가지 구성 요소로 이루어졌습니다. RAG 시스템은 LangChain, ChromaDB, FastAPI, 로컬 임베딩을 사용했으며, 청크는 조항 번호의 두 번째 수준을 기준으로 생성되었습니다(총 144개 청크). 평가는 정밀도와 재현율 지표를 사용했습니다. 답변의 사실을 기준, 즉 전체 텍스트를 확인한 LLM의 답변과 비교했습니다. 세 가지 위키 에이전트 구성(소스 접근 불가, 소스 접근 가능, 소스 접근 및 링커 사용)의 결과에서 LLM-wiki의 중앙값 재현율은 약 0.72로, RAG의 0.54~0.57과 비교되었으며, Wilcoxon 검정에서 p-값은 10⁻⁸에서 10⁻¹¹ 사이였습니다. 정밀도에서는 두 가지 구성에서만 통계적으로 유의미한 차이가 있었고(p < 0.05), 링커가 추가되면 차이가 완전히 사라졌습니다(p = 0.348). 링커는 통계적으로 유의미한 개선을 제공하지 못했습니다. 소스에 대한 접근은 사실 질문에서 약간의 도움이 있었지만, 그 효과는 미미했습니다. 저자는 이 결론이 해당 데이터셋에만 국한된다고 언급했습니다.
출처: Habr — хаб NLP —
원문
