AgentesModelos 🇷🇺 24.07.2026 05:03

De LLM a Agente: Comprendiendo las Capas entre el Modelo y la Aplicación

Google/DeepMindGoogle/DeepMind OpenAIOpenAI MistralMistral
Este artículo explora las capas entre un LLM y una aplicación de agente, comenzando desde la tokenización, el muestreo y la caché KV, pasando por las plantillas de chat y Jinja, hasta los formatos de almacenamiento de modelos y los entornos de ejecución como llama.cpp. Explica obstáculos comunes, como los tokens de razonamiento que consumen el presupuesto de generación y los problemas de longitud de contexto.
El artículo describe el camino completo desde un LLM hasta un agente. En esencia, el modelo predice el siguiente token en un bucle autorregresivo, utilizando un tokenizador para convertir texto en IDs de token y un detokenizador para convertir de vuelta. La caché KV acelera la generación al almacenar pares clave-valor anteriores. El texto de entrada que espera el modelo no es JSON en bruto, sino un prompt formateado según la plantilla de chat del modelo, que es una plantilla Jinja que convierte una lista de mensajes en una cadena con tokens especiales (por ejemplo, ChatML, Llama 3). Para modelos de razonamiento, el prompt puede incluir un bloque <think>; si el modelo gasta demasiados tokens en el razonamiento, puede agotar el presupuesto de generación antes de producir una respuesta final. El artículo también explica que la facturación y la longitud de contexto se basan en el prompt tokenizado después de la plantilla de chat, no en el JSON de la API. El almacenamiento del modelo en disco incluye los pesos safetensors, config.json, archivos de tokenizador y la plantilla de chat en tokenizer_config.json. Los entornos de ejecución como llama.cpp cargan un archivo GGUF que agrupa estos componentes, proporcionando una interfaz de alto nivel de texto a texto.
Fuente: Habr — хаб ML — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas