¿Pensando en ACE? Podemos hacerlo con menos tokens
DeepSeek
OpenAI
El blog compara dos sistemas de memoria agéntica, ACE (Ingeniería de Contexto Agéntico, por sus siglas en inglés) y ALTK-Evolve, ambos convierten las trayectorias pasadas de un agente en lecciones reutilizables sin actualizar los pesos. Coinciden en no comprimir las lecciones, pero difieren en la entrega: ACE inyecta un manual completo en cada paso, mientras que ALTK-Evolve calibra cuántas pautas enviar según el modelo y la tarea. En AppWorld, ALTK-Evolve logra una precisión igual o mejor a una fracción del costo de inferencia.
El blog presenta ALTK-Evolve y lo compara con ACE (Ingeniería de Contexto Agéntico), ambas formas de memoria agéntica que convierten las trayectorias pasadas de un agente en lecciones reutilizables, inyectadas en tiempo de inferencia sin actualizar los pesos. Los dos sistemas coinciden en el principio central de no comprimir las lecciones: ACE utiliza un manual integral y en evolución con contadores de útiles/perjudiciales por viñeta, mientras que ALTK-Evolve consolida lecciones similares en clústeres y mantiene un recuento de soporte para cada directriz, sin resumir nunca el almacén. Difieren en cómo se construye y entrega la memoria: ACE desarrolla un manual único mediante un bucle de Generador, Reflector y Curador con actualizaciones delta y deduplicación basada en incrustaciones, mientras que ALTK-Evolve agrupa cuasi-duplicados, admite fusiones con conservación del soporte y extrae directrices tipadas (estrategia, recuperación, optimización) con procedencia a nivel de subtarea. La diferencia clave está en la entrega: ACE inyecta el manual completo en cada paso, mientras que ALTK-Evolve envía un núcleo fijo pequeño de directrices de alto soporte más una selección específica por tarea, o el conjunto completo si el modelo puede manejarlo. En el benchmark AppWorld con el mismo agente ReAct, ALTK-Evolve logra puntuaciones TGC y SGC más altas o comparables con muchos menos tokens: para DeepSeek-V3.2, TGC 89.3 frente a 80.4 y 263K frente a 634K tokens por tarea; para gpt-oss-120b, TGC 56.0 frente a 54.8 y 116K frente a 777K tokens. Las ganancias de precisión provienen de recuperar unas pocas directrices por tarea en lugar de inyectar el manual completo, y el análisis por dificultad muestra que en tareas difíciles, la recuperación curada supera al manual completo, mientras que en tareas más fáciles, el manual completo puede ayudar más, pero la diferencia es pequeña. El blog señala que la propia eficiencia de ACE está en construir contexto de manera barata, mientras que la de ALTK-Evolve está en servirlo, y que la calibración de la entrega es lo que impulsa el ahorro de tokens. La biblioteca ALTK-Evolve, incluida la extracción, consolidación y canal de recuperación, está disponible, junto con un informe técnico completo.
Fuente: Hugging Face blog —
original
