Cómo la memoria de un agente de IA evitó un informe falso y forzó el abandono de su propia función
Un agente de IA basado en su memoria evitó la publicación de un informe falso al identificar que la idea ya había fallado con datos reales. En otro caso, la memoria mostró que agregar importancia global de nodos al ranking degradaba la calidad, y el agente eliminó esa función. Los desarrolladores comparten su experiencia en la creación del sistema vecmory — "memoria por significado" — que ayuda al agente a evitar repetir errores pasados.
En un artículo de Habr, los autores describen su proyecto vecmory, un sistema de memoria semántica para agentes de IA basado en el modelo multilingüe MiniLM de 384 dimensiones. El sistema realiza tres operaciones: recall (recordar lo relevante), remember (recordar) y link (vincular dos hechos). En el recall no se utiliza un top-k plano, sino una «guirnalda»: se encuentran los nodos semilla más cercanos por coseno y se despliega un grafo causal-temporal de enlaces. Se presentan dos casos significativos. Primero: un agente propuso crear un enrutador para elegir un método de ranking (coseno puro o PPR basado en grafos), obtuvo una correlación sintética de 0.98, pero antes de reportar ejecutó un recall y encontró en la memoria un registro de que esa idea ya se había probado con datos reales y había fallado. La razón es que en los embeddings reales, el coseno de pares no relacionados tiene un promedio de 0.53, mientras que el de vecinos es de 0.80; las nubes se solapan, por lo que el umbral de datos sintéticos no funciona y es necesario basarse en el rango (top-k). En el segundo caso, un agente midió el Mean Reciprocal Rank (MRR) para el ranking con coseno puro (0.81) y con la adición de la importancia global del nodo (0.41), y descubrió que la importancia empeora la calidad. En un grafo sintético, el resultado fue el inverso. Conclusión: la popularidad global es un prior de popularidad, no de relevancia; para un recall puntual, el mejor ranking es el coseno puro. Los autores señalan que la señal realmente valiosa no fue la popularidad, sino la frecuencia de correcciones repetidas por humanos (por ejemplo, revert — 39 veces, xsrf — en 60). Este conocimiento «ganado con esfuerzo» ahora se mezcla como primer bloque en cada recall. Finalmente, los autores presentan la metodología de medición: utilizaron un repositorio vivo de tickets (4299 nodos: 1993 issues + 2306 pull requests) y los patrones estándar de GitHub «Closes #N» para pares «síntoma → arreglo». En 300 consultas, el coseno puro encontró el arreglo correcto en el 38% de los casos, mientras que la navegación por el grafo causal lo hizo en el 87%, una diferencia de 49 puntos porcentuales. El script de medición es reproducible y está en el repositorio.
Fuente: Habr — хаб ML —
original
