Prompt bleek belangrijker dan model: experiment met sollicitatiebriefgeneratie
Ollama
Groq
Google/DeepMind
Сбер
Anthropic
Meta
Een ontwikkelaar van een sollicitatiebrief-app voerde een reeks experimenten uit en ontdekte dat promptkwaliteit het resultaat meer beïnvloedt dan modelkracht. Lokale modellen met 4 miljard parameters op een goede prompt toonden 100% leverbaarheid, vergelijkbaar met cloudgiganten.
Een ontwikkelaar maakte een app die sollicitatiebrieven genereert voor vacatures met behulp van een lokaal model (via Ollama) of een cloud-API, en besloot te testen in hoeverre de tekstkwaliteit afhangt van het model. Hij voerde een blinde evaluatie uit met een vriend die op zoek was naar een baan in de IT. De eerste run met drie modellen (qwen2.5:3b, qwen2.5:7b, llama-3.3-70b) resulteerde in een verstuurbaarheid van slechts 20–30%, en het cloudmodel presteerde niet beter dan het lokale model. Analyse bracht veelvoorkomende defecten aan het licht: niet ingevulde plaatshouders, verzonnen ervaring en Chinese karakters. Het bleek dat het probleem in de prompt zelf zat—die was in het Engels geschreven en miste restricties. Na het herschrijven van de prompt in het Russisch daalden mechanische fouten van 25% naar 100% netheid, maar de menselijke evaluatie bleef op nul vanwege saaiheid. De vriend wees erop dat sollicitatiebrieven diagonaal worden gescand, dus de dichtheid van hooks aan het begin van zinnen is belangrijk. Na tien iteraties legde de prompt aan het model uit hoe brieven worden gelezen, vereiste het een op feiten gebaseerde eerste regel, een korte begroeting en een aparte alinea die ingaat op de geschiktheid voor de baan. Met deze prompt bereikten lokale modellen (gemma-3-4b, qwen-3.5-4b) 100% verstuurbaarheid bij zeven van de acht brieven, terwijl Claude Opus 4.8 en GigaChat-2-Pro 100% bereikten met een levendigere stijl. In een Turingtest identificeerde de vriend 6 van de 8 gegenereerde brieven als door mensen geschreven. Conclusie: de prompt bepaalt de ondergrens, het model tilt de bovengrens op; op zwakke hardware produceert een lokaal 4B-model al fatsoenlijke brieven.
Bron: Habr — хаб ИИ —
origineel
