프롬프트, RAG, 또는 미세 조정: 실제로 LLM을 학습시키는 것은 무엇인가
이 기사에서 테크 리드인 Sergey Proshchaev는 LLM에 도메인 지식을 가르치는 세 가지 접근 방식, 즉 컨텍스트를 사용한 프롬프팅, RAG, 그리고 QLoRA 미세 조정을 비교합니다. 그는 하나의 모델(Qwen3-8B)과 하나의 GPU(RTX 4090)를 사용하여 동일한 30개의 질문에 대해 세 가지를 모두 테스트했습니다. 결과는 RAG가 사실적인 질문에 가장 적합하고, QLoRA는 형식과 용어에 뛰어나지만 업데이트된 데이터에 대해서는 실패하며, 프롬프팅은 좋은 출발점이지만 한계가 있음을 보여줍니다.
Sergey Proshchaev는 FinTech 및 전자상거래 분야의 테크 리드로, 로컬 LLM에 도메인 특화 지식을 가르치는 세 가지 방법(컨텍스트가 포함된 프롬프트, RAG(검색 증강 생성), QLoRA를 사용한 미세 조정)을 비교하는 실험을 수행했습니다. 그는 Qwen3-8B 모델과 24GB VRAM을 갖춘 단일 RTX 4090을 사용했습니다. 도메인은 내부 결제 문서로, 약 120페이지 분량의 규정(취득자 응답 코드, 재시도 규칙, 결제 라우팅, 한도, 예외 사항 포함)이었습니다. 그는 사실형, 종합형(여러 섹션에 걸친 종합 필요), 형식형(내부 사고 보고서 템플릿 따르기)의 세 가지 유형으로 30개의 질문을 만들었습니다. 프롬프팅의 경우 전체 규정을 컨텍스트(128K 토큰)에 넣었고 전체적으로 20개의 정답을 얻었지만 '중간에서 길을 잃음(Lost in the Middle)' 현상과 높은 지연 시간이 발생했습니다. RAG의 경우 청킹(오버랩 포함 500토큰), BAAI/bge-m3 임베딩, 벡터 데이터베이스로 Qdrant를 사용하여 상위 5개 청크를 검색했습니다. RAG는 사실형 질문에서 9/10을 달성하고 출처 참조를 제공했지만, 종합형 질문에서는 실패했고 내부 용어를 학습하지 못했습니다. QLoRA의 경우 더 강력한 모델로 약 800개의 질문-답변 쌍을 생성하고 수동으로 정리한 다음, LoRA 어댑터를 약 40분간 훈련했습니다. 미세 조정된 모델은 형식형 질문(10/10)에서 탁월했고 종합형 질문(8/10)에서 개선되었지만, 업데이트된 사실에서는 실패하여 데이터셋의 이전 한도를 답변했습니다. 저자는 이러한 접근 방식이 경쟁자가 아니라 계층이라고 결론지었습니다. 프롬프팅으로 시작하고, 사실적 정확성과 출처 참조를 위해 RAG를 추가하고, 모델이 특정 스타일이나 용어를 채택해야 할 때 미세 조정을 사용하십시오. 이 연구는 또한 Unsloth Studio와 H2O LLM Studio가 GUI 기반 미세 조정을 제공하고, Predibase의 LoRA Land 연구에 따르면 미세 조정된 모델이 좁은 작업에서 GPT-4를 능가할 수 있음을 언급합니다.
출처: Habr — хаб ИИ —
원문
