Prompt, RAG ou fine-tuning : ce qui fait vraiment apprendre votre LLM
Dans cet article, Sergey Proshchaev, Tech Lead dans la FinTech et l'e-commerce, compare trois approches pour enseigner des connaissances de domaine à un LLM : le prompting avec contexte, le RAG et le fine-tuning QLoRA. En utilisant un modèle (Qwen3-8B) et une seule carte graphique (RTX 4090), il a testé les trois sur les mêmes 30 questions. Les résultats montrent que le RAG est le meilleur pour les questions factuelles, le QLoRA excelle sur le format et la terminologie, mais échoue sur les données mises à jour, et le prompting est un bon point de départ, mais avec des limitations.
Sergey Proshchaev, Tech Lead dans le secteur FinTech et e-commerce, a mené une expérience pour comparer trois méthodes d'apprentissage de connaissances spécifiques à un domaine pour un LLM local : l'invite avec contexte, le RAG (génération augmentée par récupération) et le fine-tuning avec QLoRA. Il a utilisé le modèle Qwen3-8B et une seule RTX 4090 avec 24 Go de VRAM. Le domaine était la documentation de paiement interne : environ 120 pages de règlements, incluant les codes de réponse des acquéreurs, les règles de nouvelle tentative, le routage des paiements, les limites et les exceptions. Il a créé 30 questions de trois types : factuelles, synthétiques (nécessitant une synthèse entre sections) et de format (suivant un modèle de rapport d'incident interne). Pour l'invite, il a mis l'intégralité du règlement dans le contexte (128K tokens) et a obtenu 20 réponses correctes au total, mais a souffert de « Perdu au milieu » et d'une latence élevée. Pour le RAG, il a utilisé un découpage en morceaux (500 tokens avec chevauchement), des embeddings BAAI/bge-m3 et Qdrant comme base de données vectorielle, en récupérant les 5 meilleurs morceaux. Le RAG a atteint 9/10 sur les questions factuelles et a fourni des références sources, mais a échoué sur les questions synthétiques et n'a pas pu apprendre la terminologie interne. Pour QLoRA, il a généré environ 800 paires question-réponse avec un modèle plus puissant, les a nettoyées manuellement et a entraîné un adaptateur LoRA pendant environ 40 minutes. Le modèle fine-tuné a excellé dans les questions de format (10/10) et s'est amélioré sur les questions synthétiques (8/10), mais il a échoué sur les faits mis à jour, répondant avec les anciennes limites de l'ensemble de données. L'auteur conclut que ces approches ne sont pas des concurrents mais des couches : commencez par l'invite, puis ajoutez le RAG pour l'exactitude factuelle et les références sources, et utilisez le fine-tuning lorsque vous avez besoin que le modèle adopte un style ou une terminologie spécifique. L'étude mentionne également qu'Unsloth Studio et H2O LLM Studio offrent un fine-tuning avec interface graphique, et la recherche LoRA Land de Predibase a montré que les modèles fine-tunés peuvent surpasser GPT-4 sur des tâches étroites.
Source: Habr — хаб ИИ —
original
