İstem Kalitesi Modelden Daha Önemli: Ön Yazı Oluşturma Deneyi
Ollama
Groq
Google/DeepMind
Сбер
Anthropic
Meta
Bir ön yazı yazma uygulaması geliştiricisi bir dizi deney yaptı ve istem kalitesinin sonucu model gücünden daha fazla etkilediğini buldu. İyi bir istemde 4 milyar parametreli yerel modeller, bulut devleriyle karşılaştırılabilir şekilde yüzde 100 teslim edilebilirlik gösterdi.
Bir geliştirici, yerel bir model (Ollama aracılığıyla) veya bulut API'sini kullanarak iş ilanları için ön yazılar oluşturan bir uygulama yarattı ve metin kalitesinin modele ne kadar bağlı olduğunu test etmeye karar verdi. BT alanında iş arayan bir arkadaşıyla kör bir değerlendirme yaptı. Üç modelle (qwen2.5:3b, qwen2.5:7b, llama-3.3-70b) yapılan ilk çalıştırmada gönderilebilirlik yalnızca %20-30 idi ve bulut modeli yerel modelden daha iyi performans göstermedi. Analiz, yaygın kusurları ortaya çıkardı: doldurulmamış yer tutucular, uydurma deneyimler ve Çince karakterler. Sorunun, İngilizce yazılmış ve kısıtlama içermeyen prompt'un kendisinde olduğu ortaya çıktı. Prompt'u Rusça'ya yeniden yazdıktan sonra, mekanik hatalar %25'ten %100 temizliğe düştü, ancak insan değerlendirmesi sıkıcılık nedeniyle sıfırda kaldı. Arkadaş, ön yazıların çapraz olarak tarandığını, bu nedenle cümle başlarındaki kanca yoğunluğunun önemli olduğunu belirtti. On yinelemenin ardından prompt, modele mektupların nasıl okunduğunu açıkladı ve gerçeklere dayalı bir ilk satır, kısa bir selamlama ve iş uyumunu ele alan ayrı bir paragraf gerektirdi. Bu promptla yerel modeller (gemma-3-4b, qwen-3.5-4b) sekiz mektuptan yedisinde %100 gönderilebilirlik elde ederken, Claude Opus 4.8 ve GigaChat-2-Pro daha canlı bir üslupla %100 başarı sağladı. Turing testinde arkadaş, üretilen sekiz mektuptan altısını insan yazımı olarak tanımladı. Sonuç: prompt tabanı belirler, model tavanı yükseltir; zayıf donanımda yerel bir 4B model zaten iyi mektuplar üretiyor.
Kaynak: Habr — хаб ИИ —
orijinal
