Modelos 🇷🇺 27.07.2026 09:03

RAG: Los Benchmarks Importan Más Que el Código. La Historia de un Bot Donde las Mejoras 'Apropiadas' Empeoraron el Resultado

Un desarrollador creó un bot RAG para moderar chats de criptomonedas, pero descubrió que las mejoras estándar — BM25 y un reranker — solo degradaban las métricas. El único cambio efectivo fue calibrar el umbral de corte. El artículo enfatiza la importancia de realizar evaluaciones comparativas exhaustivas con tus propios datos.
Un desarrollador se propuso construir un bot RAG para ofrecer soporte específico a usuarios de chat de criptomonedas: el bot debía encontrar consultas similares y mostrar respuestas de administradores ya existentes. Usando un corpus de 3,9 millones de mensajes y un conjunto de evaluación de 51 preguntas, midió un hit@3 de referencia para la búsqueda vectorial pura del 74 %. Al intentar mejorar el sistema, añadió búsqueda híbrida con BM25 y un reranker de codificador cruzado. Ambos cambios redujeron la métrica: el híbrido dio un 55 %, el reranker un 64 %, y el híbrido más reranker un 57 %. El análisis mostró que BM25 era ineficaz debido a la ausencia de tokens exactos en el corpus de preguntas de muestra, mientras que el reranker estropeaba una clasificación ya buena. El único cambio beneficioso fue ajustar el umbral de corte para adaptarlo al rol del bot (como recurso de respaldo, no como respondedor final): esto mejoró la salida útil sin necesidad de código adicional. La conclusión principal es que en RAG lo que importa no son los valores predeterminados del sector, sino las mediciones honestas y la limpieza de datos.
Fuente: Habr — хаб ИИ — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas