AI 에이전트 지식 베이스 구축 및 본인 의료 검사 결과로 테스트하기
Iskra의 백엔드 개발자가 자신의 의료 검사 결과를 업로드하여 회사의 AI 에이전트 지식 베이스를 테스트했습니다. 본인의 검사 데이터에 대한 답변에서 오류를 즉시 발견할 수 있었기 때문입니다. 이 시스템은 전통적인 RAG 대신 문서 미러, grep, 그래프 링크를 사용하는 파일 시스템 방식 접근법을 사용하는데, 잘 작동하지만 에이전트가 지식 베이스에 접근하는 것을 잊어버리는 등의 함정이 있습니다.
저자는 Iskra의 백엔드 개발자로서 AI 에이전트용 지식 베이스를 구축하고, 자신의 건강검진 결과로 테스트했습니다. 이 결과는 본인이 외우고 있던 내용이라 오류가 명확히 드러났습니다. 이 시스템은 검색 인덱스라기보다는 준비된 파일 시스템처럼 작동합니다. 각 파일에는 YAML 헤더가 있는 미러링된 .md 파일이 있으며, 에이전트는 ls, grep, read, 링크 따라가기를 통해 탐색합니다. 이 접근 방식은 여러 문서에 걸친 답변과 출처 인용에서 기존의 RAG보다 우수합니다. 에이전트가 청크 대신 전체 문서를 읽기 때문입니다. 하지만 에이전트가 가끔 지식 베이스에 접근하는 것을 잊어버리기도 합니다. 예를 들어 첨부 파일을 볼 수 없다고 주장했다가 재시도에서는 7개를 모두 읽고 정확한 요약을 제공한 경우가 있었습니다. 추가적인 문제로는 파일 이름이 이상하게 바뀌는 경우(일부 제목이 라틴어로 표기됨), 인용 시 의역으로 인한 부정확성, 그리고 복잡한 쿼리당 약 10~15회의 도구 호출로 인한 높은 토큰 비용이 있습니다. 저자는 이 시스템이 완벽하지 않다고 지적합니다. 모델이 출처를 인용할 수 있지만 여전히 환각을 일으킬 수 있으므로 서버 측 출처 목록이 중요합니다.
출처: Habr — хаб NLP —
원문
