KERNEL Beş Dakikada: İyi Bir İstem Neden Teknik Şartname Gibi Görünür?
SYNTX.AI
Makale, prompt mühendisliği için KERNEL çerçevesini açıklıyor; yazar bunu basit bir tarif olarak tanımlıyor: basit tut, doğrulaması kolay, tekrarlanabilir sonuçlar, dar kapsam, açık kısıtlamalar ve mantıklı yapı. KERNEL günlük prompt kullanımı için faydalı olsa da, makale gerçek büyük dil modeli üretiminin iyi promptlardan daha fazlasını gerektirdiğini savunuyor—değerlendirmeler (evals), bağlam mühendisliği ve araç entegrasyonu dahil. Yazar, modelleri karşılaştırmak için SYNTX.AI kullanarak edindiği kişisel deneyimleri paylaşıyor.
Yazar, KERNEL adlı topluluk temelli bir prompt yazma çerçevesini annesine beş dakikada anlatıyor ve bunun teknik bir şartname gibi göründüğünü fark ediyor. KERNEL, "Keep it simple" (Basit tut), "Easy to verify" (Doğrulaması kolay), "Reproducible results" (Tekrarlanabilir sonuçlar), "Narrow scope" (Dar kapsam), "Explicit constraints" (Açık kısıtlamalar) ve "Logical structure" (Mantıksal yapı) kelimelerinin baş harflerinden oluşuyor. Bu çerçeve, binden fazla promptu analiz eden bir yazar tarafından oluşturulmuş ve ilk denemede başarı oranının %72'den %94'e çıktığını, token kullanımının %58 azaldığını ve faydalı sonuca ulaşma süresinin %67 düştüğünü iddia ediyor; ancak bu makalenin yazarı, yayınlanmış bir metodoloji olmadan bu rakamlara şüpheyle yaklaşıyor. Makale, iyi promptların genellikle iyi yazılmış teknik görevlere benzediğini ve 'adım adım düşün' gibi tekniklerin yardımcı olabileceğini, ancak modern akıl yürütme modellerinin bunu zaten dahili olarak ele aldığını belirtiyor. En tartışmalı harf, Tekrarlanabilir sonuçlar için kullanılan R; yazar bunu aynı çıktılar olarak değil, model sürümleri ve promptlar arasında karşılaştırmaya olanak tanıyan tekrarlanabilir gereksinimler olarak yeniden yorumluyor. Üretimde, yalnızca promptlar yeterli değildir; model davranışını ölçmek için evaller (önceden tanımlanmış testler) gerekir ve prompt mantığının bir kısmı (JSON yapısını zorlamak gibi) kod içine şemalar aracılığıyla taşınmak daha iyidir. Model seçimi de önemlidir: farklı büyük dil modelleri (LLM'ler) aynı promptta farklı performans gösterir, bu nedenle belirli kriterlere göre modelleri karşılaştırmak esastır. Yazar, birden fazla LLM'yi tek bir alandan çalıştırmak için SYNTX.AI kullanıyor ve makale, KERNEL'in hızlı bir kontrol listesi olarak hâlâ faydalı olduğu, ancak gerçek LLM sistemlerinin RAG, araç kullanımı ve durum yönetimi dahil olmak üzere bağlam mühendisliği gerektirdiği sonucuna varıyor. Yazı, SYNTX.AI için tanıtım notu ve bir promosyon kodu ile bitiyor.
Kaynak: Habr — хаб ИИ —
orijinal
