Arquitectura de Referencia para el Arnés de IA Empresarial en Kubernetes: Cuatro Capas para el Despliegue Seguro de Agentes en Producción
Anthropic
LiteLLM
El artículo propone una arquitectura de referencia para un arnés de IA empresarial auto-alojado en Kubernetes, compuesta por cuatro capas funcionales: Entrada, Bucle del Agente, Ejecución e Identidad, Políticas y Auditoría. Su objetivo es abordar la complejidad del despliegue de agentes de IA en producción, definiendo límites claros entre las capas y permitiendo el reemplazo modular de componentes. La arquitectura se basa en el modelo de Anthropic, proyectos de la CNCF y el ecosistema MCP, con énfasis en seguridad, multi-inquilino y despliegue nativo de Kubernetes.
El artículo presenta una arquitectura de referencia para construir un Enterprise AI Harness autogestionado en Kubernetes, estructurada en cuatro capas: Entrada, Bucle del Agente, Ejecución e Identidad, Política y Auditoría. La capa de Entrada separa el tráfico de usuarios, agentes y eventos mediante herramientas como Traefik y webhooks de n8n. La capa de Bucle del Agente (ReAct) gestiona sesiones de agentes con estado, incluyendo memoria, delegación e intervención humana (human-in-the-loop, HITL), utilizando componentes como kagent y LangGraph. La capa de Ejecución controla el acceso a recursos externos (herramientas MCP, flujos de trabajo, modelos de lenguaje grandes o LLMs) a través de FastMCP, n8n y LiteLLM. La capa de Identidad, Política y Auditoría proporciona autenticación, autorización y auditoría transversales mediante Keycloak, agentgateway, Vault/OpenBao y OTEL/Grafana. La arquitectura enfatiza los límites de seguridad, la multi-tenencia (a través de seguridad a nivel de fila o RLS, espacios de nombres y políticas de red) y el contexto de despliegue (Kubernetes, Helm, NetworkPolicy). Las habilidades se implementan como inyecciones de capacidades locales en el pod (imágenes OCI con SKILL.md), mientras que las herramientas son accesibles a través de la red. El artículo ilustra el flujo de trabajo con un ejemplo de tarea de ingeniería, mostrando cómo la identidad fluye desde la entrada a través de agentgateway hasta la ejecución, con pistas de auditoría en todo el proceso. El autor señala que este es un modelo de referencia funcional, no un producto, e invita a debatir sobre las capas esenciales.
Fuente: Habr — хаб NLP —
original
