애플리케이션 🇷🇺 27.07.2026 13:03

프롬프트가 모델보다 더 중요하다: 자기소개서 생성 실험

OllamaOllama GroqGroq Google/DeepMindGoogle/DeepMind СберСбер AnthropicAnthropic MetaMeta
자기소개서 작성 앱 개발자가 일련의 실험을 수행한 결과, 프롬프트 품질이 모델 성능보다 결과에 더 큰 영향을 미친다는 사실을 발견했습니다. 좋은 프롬프트를 사용한 40억 파라미터의 로컬 모델이 클라우드 거대 기업과 견줄 만한 100% 전달 가능성을 보여주었습니다.
한 개발자가 로컬 모델( Ollama 사용) 또는 클라우드 API를 사용하여 채용 공고용 자기소개서를 생성하는 앱을 만들고, 텍스트 품질이 모델에 얼마나 의존하는지 테스트하기로 했습니다. 그는 IT 분야에서 일자리를 찾고 있던 친구와 함께 맹목 평가를 실시했습니다. 세 가지 모델(qwen2.5:3b, qwen2.5:7b, llama-3.3-70b)로 첫 실행한 결과 보낼 수 있는 수준은 20~30%에 불과했고, 클라우드 모델이 로컬 모델을 능가하지 못했습니다. 분석 결과 일반적인 결함이 드러났습니다: 채워지지 않은 자리 표시자, 지어낸 경력, 그리고 중국어 문자가 포함되어 있었습니다. 문제는 프롬프트 자체에 있었습니다—영어로 작성되었고 제한 사항이 없었습니다. 프롬프트를 러시아어로 다시 작성한 후, 기계적 오류는 25%에서 100% 깨끗함으로 줄었지만, 인간 평가는 지루함으로 인해 여전히 0점이었습니다. 친구는 자기소개서가 대각선으로 훑어 읽힌다는 점을 지적하며, 문장 시작 부분의 인상적인 요소 밀도가 중요하다고 말했습니다. 열 번의 반복 끝에 프롬프트는 모델에게 편지가 어떻게 읽히는지 설명하고, 사실 기반의 첫 줄, 짧은 인사말, 그리고 직무 적합성을 다루는 별도의 단락을 요구했습니다. 이 프롬프트로 로컬 모델(gemma-3-4b, qwen-3.5-4b)은 8통 중 7통에서 100% 보낼 수 있는 수준을 달성했고, Claude Opus 4.8과 GigaChat-2-Pro는 더 생동감 있는 스타일로 100%를 달성했습니다. 튜링 테스트에서 친구는 생성된 8통 중 6통을 인간이 쓴 것으로 식별했습니다. 결론: 프롬프트가 최저 수준을 설정하고, 모델이 최고 수준을 높입니다; 약한 하드웨어에서도 로컬 4B 모델이 이미 괜찮은 편지를 생성합니다.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스