提示比模型更重要:封面信生成实验
Ollama
Groq
Google/DeepMind
Сбер
Anthropic
Meta
一位封面信写作应用的开发者进行了一系列实验,发现提示质量对结果的影响大于模型能力。本地40亿参数模型在优质提示下表现出100%的交付能力,与云端巨头相当。
一位开发者创建了一款应用,利用本地模型(通过Ollama)或云API为职位空缺生成求职信,并决定测试文本质量对模型的依赖程度。他与一位正在IT行业求职的朋友进行了盲测。第一轮使用三个模型(qwen2.5:3b、qwen2.5:7b、llama-3.3-70b)生成的结果,可发送性仅为20%-30%,而云模型并未优于本地模型。分析发现常见缺陷:占位符未填写、捏造的经历以及中文字符。结果发现问题出在提示本身——它用英文编写,且缺乏限制。将提示改写为俄文后,机械错误从25%降至100%的清洁度,但人工评估因内容乏味仍然为零。朋友指出,求职信通常被快速扫读,因此短语开头吸引注意力的密度很重要。经过十次迭代后,提示向模型解释了信件如何被阅读,要求以基于事实的第一行开头,简短问候,并单独一段说明与职位的匹配度。使用此提示,本地模型(gemma-3-4b、qwen-3.5-4b)在八封信中有七封达到100%的可发送性,而Claude Opus 4.8和GigaChat-2-Pro则达到100%且风格更生动。在图灵测试中,朋友将8封生成的信件中的6封识别为人类撰写。结论:提示设定了下限,模型提升了上限;在硬件较弱的情况下,本地4B模型已能生成像样的信件。
来源: Habr — хаб ИИ —
原文
