AgentsModèles 🇷🇺 24.07.2026 05:03

Du LLM à l'agent : comprendre les couches entre le modèle et l'application

Google/DeepMindGoogle/DeepMind OpenAIOpenAI MistralMistral
Cet article explore les couches entre un LLM et une application agent, en commençant par la tokenisation, l'échantillonnage et le cache KV, en passant par les modèles de chat et Jinja, jusqu'aux formats de stockage de modèles et aux exécutants comme llama.cpp. Il explique les pièges courants tels que les jetons de raisonnement qui consomment le budget de génération et les problèmes de longueur de contexte.
L'article décrit le chemin complet d'un LLM à un agent. Au cœur, le modèle prédit le token suivant dans une boucle autorégressive, en utilisant un tokeniseur pour convertir le texte en identifiants de tokens et un détokeniseur pour reconvertir en texte. Le cache KV accélère la génération en stockant les paires clé-valeur précédentes. Le texte d'entrée attendu par le modèle n'est pas du JSON brut mais une invite formatée selon le modèle de discussion du modèle, qui est un modèle Jinja convertissant une liste de messages en une chaîne avec des tokens spéciaux (par exemple, ChatML, Llama 3). Pour les modèles de raisonnement, l'invite peut inclure un bloc <think> ; si le modèle consacre trop de tokens au raisonnement, il peut épuiser le budget de génération avant de produire une réponse finale. L'article explique également que la facturation et la longueur du contexte sont basées sur l'invite tokenisée après le modèle de discussion, et non sur le JSON de l'API. Le stockage du modèle sur disque comprend les poids safetensors, config.json, les fichiers du tokeniseur et le modèle de discussion dans tokenizer_config.json. Les environnements d'exécution comme llama.cpp chargent un fichier GGUF qui regroupe ces composants, fournissant une interface de haut niveau du texte au texte.
Source: Habr — хаб ML — original
Nos articles précédents sur ce sujet ↓
Infos fraîches