Lo que nos enseñó la construcción del agente Shippy: cómo construir agentes de IA fiables para tareas operativas
Allen Institute for AI
Anthropic
El equipo de Skylight (Ai2) compartió su experiencia desarrollando Shippy, un agente de IA para el conocimiento marítimo. El principal desafío es garantizar la fiabilidad en condiciones de alto riesgo. La arquitectura de Shippy incluye un "alma" (prompt del sistema), habilidades (archivos markdown) y configuración. Para el determinismo, el agente utiliza una interfaz de línea de comandos en lugar de llamadas directas a la API. Cada usuario trabaja en una sesión aislada a través de la plataforma Mothership. La evaluación del agente se realiza con datos en vivo utilizando escenarios personalizados; Shippy está abierto para pruebas por usuarios iniciales.
El equipo de Skylight (una división de Ai2) ha presentado Shippy, un agente de IA para el conocimiento situacional marítimo en tiempo real. El principal desafío es la fiabilidad: un error podría enviar un buque patrullero al lugar equivocado. La arquitectura de Shippy consta de tres partes: el alma (un prompt del sistema que define los límites de comportamiento), las habilidades (un conjunto de instrucciones en formato Markdown con front matter) y la configuración (el entorno de ejecución OpenClaw, el modelo de lenguaje Claude Opus 4.6 y parámetros de ejecución). Las habilidades describen consultas típicas: búsqueda de eventos, límites de zonas económicas exclusivas, interpretación de trayectorias de buques y generación de enlaces a mapas. Para reducir la indeterminación, Shippy se comunica con la API de Skylight a través de una interfaz de línea de comandos (CLI) especial que se encarga de la autenticación, la paginación y el formato de salida. Esto elimina los errores típicos de las llamadas directas. Para aislar los datos de los usuarios, se ha construido la plataforma Mothership: cada sesión crea un despliegue independiente de Kubernetes vinculado al JSON Web Token (JWT) del usuario. La evaluación del agente se realiza con datos reales: los expertos redactan escenarios con categorías y ponderaciones, un juez basado en un modelo de lenguaje evalúa cada criterio, los resultados se agregan y se comparan con un umbral. Las pruebas se ejecutan a través del marco de trabajo Harbor. Shippy está abierto a los primeros usuarios, y los planes futuros incluyen la gestión del mapa a través del agente, el enrutamiento de consultas a diferentes modelos y la memoria entre sesiones. La experiencia con Shippy también se utiliza para los proyectos EarthRanger y OlmoEarth.
Fuente: Hugging Face blog —
original
