プロンプト、RAG、ファインチューニング:LLMを学ばせる本当に効果的な方法
この記事では、FinTechおよびEコマース分野のテックリードであるSergey Proshchaev氏が、LLMにドメイン知識を教える3つのアプローチ(コンテキスト付きプロンプト、RAG、QLoRAファインチューニング)を比較しています。同じモデル(Qwen3-8B)と1つのGPU(RTX 4090)を使用し、同じ30の質問で3つの手法をテストしました。結果は、RAGが事実に基づく質問に最適であり、QLoRAは形式と用語に優れるが、更新されたデータには対応できないこと、プロンプトは良い出発点であるが限界があることを示しています。
Sergey Proshchaev(FinTechとEコマースのテックリード)は、ローカルLLMにドメイン固有の知識を教える3つの方法(コンテキスト付きプロンプト、RAG(検索拡張生成)、QLoRAによるファインチューニング)を比較する実験を行いました。彼はQwen3-8Bモデルと24 GB VRAMのRTX 4090を1台使用しました。ドメインは社内の決済ドキュメントで、約120ページの規制(アクワイアラ応答コード、リトライルール、支払いルーティング、限度額、例外を含む)です。彼は、事実に関するもの、合成(セクションを横断した総合が必要)、形式(社内インシデントレポートのテンプレートに従う)の3種類の質問を30問作成しました。プロンプティングでは、全規制をコンテキスト(128Kトークン)に入れ、全体で20問正解しましたが、「Lost in the Middle」問題と高レイテンシに悩まされました。RAGでは、チャンキング(500トークン、オーバーラップあり)、BAAI/bge-m3埋め込み、ベクトルデータベースとしてQdrantを使用し、上位5チャンクを取得しました。RAGは事実に関する質問で9/10を達成し、ソース参照を提供しましたが、合成質問では失敗し、内部用語を学習できませんでした。QLoRAでは、より強力なモデルで約800の質問応答ペアを生成し、手動でクリーニングし、LoRAアダプタを約40分トレーニングしました。ファインチューニングされたモデルは形式質問(10/10)に優れ、合成質問(8/10)でも改善しましたが、更新された事実には失敗し、データセットの古い限度額を回答しました。著者は、これらのアプローチは競合ではなくレイヤーであると結論付けています:まずプロンプティングから始め、次に事実の正確性とソース参照のためにRAGを追加し、モデルに特定のスタイルや用語を採用させたいときにファインチューニングを使用します。この研究では、Unsloth StudioとH2O LLM StudioがGUIベースのファインチューニングを提供していること、PredibaseのLoRA Landの研究が、ファインチューニングされたモデルが狭いタスクでGPT-4を超える可能性を示したことも言及しています。
出典: Habr — хаб ИИ —
原文
