Modellen 🇷🇺 04.08.2026 11:04

Prompt, RAG of fine-tuning: wat zorgt er nu echt voor dat je LLM leert

In dit artikel vergelijkt Sergey Proshchaev, een Tech Lead in FinTech & E-commerce, drie benaderingen om een LLM domeinkennis bij te brengen: prompting met context, RAG en QLoRA-finetuning. Met behulp van één model (Qwen3-8B) en één GPU (RTX 4090) testte hij alle drie op dezelfde 30 vragen. De resultaten tonen aan dat RAG het beste is voor feitelijke vragen, QLoRA uitblinkt in formaat en terminologie, maar faalt op bijgewerkte gegevens, en prompting is een goed startpunt maar heeft beperkingen.
Sergey Proshchaev, Tech Lead in FinTech & E-commerce, heeft een experiment uitgevoerd om drie manieren te vergelijken om een lokale LLM domeinspecifieke kennis bij te brengen: prompt met context, RAG (retrieval-augmented generation, dat wil zeggen generatie met terugwinning van informatie) en fine-tuning met QLoRA. Hij gebruikte het Qwen3-8B-model en een enkele RTX 4090 met 24 GB VRAM. Het domein was interne betalingsdocumentatie: ongeveer 120 pagina's aan regelgeving, waaronder acquirer-responscodes, regels voor opnieuw proberen, betalingsroutering, limieten en uitzonderingen. Hij stelde 30 vragen op van drie typen: feitelijk, synthetisch (waarvoor synthese over secties heen nodig is) en opmaken (volgens een intern incidentrapportagesjabloon). Bij prompting plaatste hij de volledige regelgeving in de context (128K tokens) en kreeg hij in totaal 20 correcte antwoorden, maar had hij last van 'Lost in the Middle' en hoge latentie. Voor RAG gebruikte hij chunking (500 tokens met overlapping), BAAI/bge-m3-embeddings en Qdrant als vectordatabase, waarbij hij de top-5 chunks ophaalde. RAG behaalde 9/10 op feitelijke vragen en leverde bronverwijzingen, maar faalde op synthetische vragen en kon geen interne terminologie leren. Voor QLoRA genereerde hij ongeveer 800 vraag-antwoordparen met een sterker model, maakte deze handmatig schoon en trainde hij een LoRA-adapter gedurende ongeveer 40 minuten. Het fijn afgestelde model excelleerde in opmaakvragen (10/10) en verbeterde op synthetische vragen (8/10), maar faalde op bijgewerkte feiten, omdat het oude limieten uit de dataset gaf. De auteur concludeert dat deze benaderingen geen concurrenten zijn, maar lagen: begin met prompting, voeg dan RAG toe voor feitelijke nauwkeurigheid en bronverwijzingen, en gebruik fine-tuning wanneer u wilt dat het model een specifieke stijl of terminologie aanneemt. De studie vermeldt ook dat Unsloth Studio en H2O LLM Studio GUI-gebaseerde fine-tuning bieden, en het LoRA Land-onderzoek van Predibase toonde aan dat fijn afgestelde modellen GPT-4 kunnen overtreffen bij smalle taken.
Bron: Habr — хаб ИИ — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws