AjanlarModeller 🇷🇺 24.07.2026 05:03

LLM'den Ajan'a: Model ve Uygulama Arasındaki Katmanları Anlamak

Google/DeepMindGoogle/DeepMind OpenAIOpenAI MistralMistral
Bu makale, bir LLM ile ajan uygulaması arasındaki katmanları keşfediyor; tokenizasyon, örnekleme ve KV-önbellekten, sohbet şablonları ve Jinja'ya, model depolama biçimlerine ve llama.cpp gibi çalışma zamanlarına kadar. Akıl yürütme tokenlerinin üretim bütçesini tüketmesi ve bağlam uzunluğu sorunları gibi yaygın tuzakları açıklıyor.
Makale, bir LLM'den bir ajana giden tam yolu açıklıyor. Temelde model, bir tokenlaştırıcı kullanarak metni token kimliklerine dönüştüren ve bir detokenlaştırıcı ile geri dönüştüren bir otoregresif döngüde sonraki tokenı tahmin eder. KV-önbelleği, önceki anahtar-değer çiftlerini depolayarak üretimi hızlandırır. Modelin beklediği girdi metni ham JSON değil, modelin sohbet şablonuna göre biçimlendirilmiş bir istemdir; bu, bir mesaj listesini özel tokenlar (örneğin, ChatML, Llama 3) içeren bir dizeye dönüştüren bir Jinja şablonudur. Akıl yürütme modelleri için istem bir <think> bloğu içerebilir; model akıl yürütmeye çok fazla token harcarsa, nihai bir cevap üretmeden önce üretim bütçesi tükenebilir. Makale ayrıca faturalandırma ve bağlam uzunluğunun, API JSON'ına değil, sohbet şablonundan sonra tokenlaştırılmış isteme dayandığını açıklıyor. Disk üzerinde model depolaması, safetensors ağırlıklarını, config.json'ı, tokenlaştırıcı dosyalarını ve tokenizer_config.json'daki sohbet_şablonunu içerir. llama.cpp gibi çalışma zamanları, bu bileşenleri birleştiren bir GGUF dosyası yükleyerek metinden metne yüksek seviyeli bir arayüz sağlar.
Kaynak: Habr — хаб ML — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler