Prompt wichtiger als Modell: Experiment zur Anschreiben-Generierung
Ollama
Groq
Google/DeepMind
Сбер
Anthropic
Meta
Ein Entwickler einer Bewerbungsschreiben-App führte eine Reihe von Experimenten durch und fand heraus, dass die Prompt-Qualität das Ergebnis mehr beeinflusst als die Modellleistung. Lokale Modelle mit 4 Milliarden Parametern bei einem guten Prompt zeigten eine 100-prozentige Zustellbarkeit, vergleichbar mit Cloud-Giganten.
Ein Entwickler hat eine App erstellt, die Anschreiben für Stellenausschreibungen mithilfe eines lokalen Modells (über Ollama) oder einer Cloud-API generiert, und beschloss zu testen, wie stark die Textqualität vom Modell abhängt. Er führte eine Blindbewertung mit einem Freund durch, der auf der Suche nach einem Job in der IT war. Der erste Durchlauf mit drei Modellen (qwen2.5:3b, qwen2.5:7b, llama-3.3-70b) ergab eine Versandbereitschaft von nur 20–30 %, und das Cloud-Modell schnitt nicht besser ab als das lokale. Die Analyse zeigte häufige Mängel: nicht ausgefüllte Platzhalter, erfundene Erfahrungen und chinesische Zeichen. Es stellte sich heraus, dass das Problem im Prompt selbst lag – er war auf Englisch verfasst und enthielt keine Einschränkungen. Nachdem der Prompt auf Russisch neu geschrieben wurde, sanken die mechanischen Fehler von 25 % auf 100 % Sauberkeit, aber die menschliche Bewertung blieb bei null, weil die Texte langweilig waren. Der Freund wies darauf hin, dass Anschreiben diagonal überflogen werden, daher ist die Dichte der Aufhänger am Satzanfang wichtig. Nach zehn Iterationen erklärte der Prompt dem Modell, wie Briefe gelesen werden, verlangte eine faktenbasierte erste Zeile, eine kurze Begrüßung und einen eigenen Absatz, der auf die Eignung für die Stelle eingeht. Mit diesem Prompt erreichten lokale Modelle (gemma-3-4b, qwen-3.5-4b) eine 100-prozentige Versandbereitschaft bei sieben von acht Briefen, während Claude Opus 4.8 und GigaChat-2-Pro 100 % mit einem lebendigeren Stil erreichten. In einem Turing-Test identifizierte der Freund 6 von 8 generierten Briefen als von Menschen geschrieben. Fazit: Der Prompt setzt die Messlatte, das Modell hebt die Decke; auf schwacher Hardware liefert ein lokales 4B-Modell bereits ordentliche Briefe.
Quelle: Habr — хаб ИИ —
Original
