Le prompt s'est avéré plus important que le modèle : expérience de génération de lettres de motivation
Ollama
Groq
Google/DeepMind
Сбер
Anthropic
Meta
Un développeur d'une application de rédaction de lettres de motivation a mené une série d'expériences et a constaté que la qualité du prompt affecte davantage le résultat que la puissance du modèle. Des modèles locaux de 4 milliards de paramètres avec un bon prompt ont montré une délivrabilité de 100 %, comparable à celle des géants du cloud.
Un développeur a créé une application qui génère des lettres de motivation pour des offres d'emploi en utilisant un modèle local (via Ollama) ou une API cloud, et a décidé de tester à quel point la qualité du texte dépend du modèle. Il a mené une évaluation en aveugle avec un ami qui cherchait un emploi dans l'informatique. Lors de la première exécution avec trois modèles (qwen2.5:3b, qwen2.5:7b, llama-3.3-70b), le taux d'envoi n'était que de 20 à 30 %, et le modèle cloud n'a pas surpassé le modèle local. L'analyse a révélé des défauts courants : des espaces réservés non remplis, une expérience fictive et des caractères chinois. Il s'est avéré que le problème venait du prompt lui-même : il était rédigé en anglais et manquait de restrictions. Après avoir réécrit le prompt en russe, les erreurs mécaniques ont chuté de 25 % à une propreté de 100 %, mais l'évaluation humaine est restée à zéro en raison de l'ennui. L'ami a fait remarquer que les lettres de motivation sont parcourues en diagonale, d'où l'importance d'une densité d'accroches en début de phrases. Après dix itérations, le prompt expliquait au modèle comment les lettres sont lues, exigeait une première ligne factuelle, une brève salutation et un paragraphe séparé traitant de l'adéquation au poste. Avec ce prompt, les modèles locaux (gemma-3-4b, qwen-3.5-4b) ont atteint un taux d'envoi de 100 % sur sept lettres sur huit, tandis que Claude Opus 4.8 et GigaChat-2-Pro ont obtenu 100 % avec un style plus vivant. Dans un test de Turing, l'ami a identifié 6 des 8 lettres générées comme étant écrites par des humains. Conclusion : le prompt fixe le plancher, le modèle élève le plafond ; sur un matériel modeste, un modèle local de 4B produit déjà des lettres décentes.
Source: Habr — хаб ИИ —
original
