Construyendo el entorno empresarial para la IA agentiva
Intel Corporation
Anthropic
Intel comparte cinco lecciones prácticas para las empresas que implementan IA agentiva, enfatizando que el éxito requiere un entorno completo más allá de la simple inferencia de modelos de lenguaje de gran tamaño (LLM), con métricas como la densidad de agentes por vCPU y la latencia P95. El artículo describe un enfoque en tres fases: planificación por densidad de agentes, adopción de nuevas prácticas de observabilidad y escalado horizontal por defecto.
Intel llevó a cabo miles de experimentos con cargas de trabajo de IA agente y extrajo cinco lecciones para líderes empresariales. Sostienen que la IA agente es un problema de sistemas más amplio, no solo de inferencia, y que la mayoría de las plataformas existentes no miden el rendimiento general del sistema. La capacidad debe planificarse utilizando la densidad de agentes por vCPU (unidad virtual de procesamiento central), no el número de agentes. Monitorear la latencia de las tareas de los agentes (percentil 95) es más informativo que el uso promedio de la CPU. Los sistemas que alojan agentes deberían escalar horizontalmente de forma predeterminada, reservando el escalado vertical para cargas de trabajo con mayor cómputo por agente. Intel amplió Terminal-Bench para evaluar cargas de trabajo de IA agente, utilizando una reproducción determinista de respuestas de modelos de lenguaje de gran tamaño (LLM, por sus siglas en inglés) para separar el rendimiento de los agentes de la variabilidad del LLM. La combinación de tareas incluyó compilación, pruebas, operaciones de bases de datos y más. La implementación de IA agente debería realizarse en tres fases: planificar según la densidad de agentes, adoptar nueva observabilidad centrada en la latencia del percentil 95 y escalar horizontalmente de forma predeterminada. El artículo también identifica perfiles empresariales para la IA agente: líderes responsables que mejoran el tiempo de ciclo, la productividad y la gestión de costos.
Fuente: MIT Technology Review —
original
