العواملالنماذج 🇷🇺 24.07.2026 05:03

من LLM إلى الوكيل: فهم الطبقات بين النموذج والتطبيق

Google/DeepMindGoogle/DeepMind OpenAIOpenAI MistralMistral
تستكشف هذه المقالة الطبقات بين نموذج اللغة الكبير وتطبيق الوكيل، بدءًا من الترميز وأخذ العينات وذاكرة التخزين المؤقت KV، وصولاً إلى قوالب الدردشة وJinja، وتنسيقات تخزين النماذج وبيئات التشغيل مثل llama.cpp. تشرح المقالة الأخطاء الشائعة مثل رموز الاستدلال التي تستهلك ميزانية التوليد ومشكلات طول السياق.
تصف المقالة المسار الكامل من نموذج اللغة الكبير (LLM) إلى وكيل (agent). في جوهر النموذج، يتنبأ بالرمز التالي في حلقة توليد ذاتي الانحدار (autoregressive loop)، مستخدمًا أداة تحويل النص إلى رموز (tokenizer) لتحويل النص إلى معرفات الرموز (token IDs)، وأداة تحويل الرموز إلى نص (detokenizer) للتحويل العكسي. يُسرّع ذاكرة التخزين المؤقت للقيمة والمفاتيح (KV-cache) عملية التوليد عن طريق تخزين أزواج القيمة والمفاتيح السابقة. النص الذي يتوقعه النموذج ليس بيانات JSON خام، بل هو موجه (prompt) منسق وفقًا لقالب المحادثة (chat template) الخاص بالنموذج، وهو قالب من نوع Jinja يحول قائمة من الرسائل إلى سلسلة نصية تحتوي على رموز خاصة (مثل ChatML و Llama 3). بالنسبة لنماذج التفكير (reasoning models)، قد يتضمن الموجه كتلة <think>؛ إذا استهلك النموذج عددًا كبيرًا جدًا من الرموز في التفكير، فقد ينفد منه ميزانية التوليد (generation budget) قبل إنتاج إجابة نهائية. كما تشرح المقالة أن الفوترة (billing) وطول السياق (context length) يعتمدان على الموجه بعد تحويله إلى رموز (tokenized prompt) بواسطة قالب المحادثة، وليس على JSON الخاص بواجهة برمجة التطبيقات (API JSON). يتضمن تخزين النموذج على القرص ملفات الأوزان بصيغة safetensors، وملف config.json، وملفات أداة تحويل النص إلى رموز، وchat_template في ملف tokenizer_config.json. تقوم بيئات التشغيل (runtimes) مثل llama.cpp بتحميل ملف GGUF الذي يجمع هذه المكونات، مما يوفر واجهة عالية المستوى من النص إلى النص.
المصدر: Habr — хаб ML — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة