Prompt, RAG o fine-tuning: qué hace que tu modelo de lenguaje realmente aprenda
En este artículo, Sergey Proshchaev, líder técnico en FinTech y comercio electrónico, compara tres enfoques para enseñar conocimiento de dominio a un modelo de lenguaje grande (LLM): prompting con contexto, RAG y fine-tuning con QLoRA. Usando un modelo (Qwen3-8B) y una GPU (RTX 4090), probó los tres con las mismas 30 preguntas. Los resultados muestran que RAG es el mejor para preguntas factuales, QLoRA sobresale en formato y terminología, pero falla en datos actualizados, y el prompting es un buen punto de partida pero tiene limitaciones.
Sergey Proshchaev, líder técnico en FinTech y comercio electrónico, llevó a cabo un experimento para comparar tres formas de enseñar a un LLM local conocimientos específicos de un dominio: aviso con contexto, RAG (generación aumentada por recuperación) y ajuste fino con QLoRA. Utilizó el modelo Qwen3-8B y una única RTX 4090 con 24 GB de VRAM. El dominio era la documentación interna de pagos: unas 120 páginas de normativas, incluidos códigos de respuesta del adquirente, reglas de reintentos, enrutamiento de pagos, límites y excepciones. Creó 30 preguntas de tres tipos: factuales, sintéticas (que requieren síntesis entre secciones) y de formato (siguiendo una plantilla de informe de incidentes interna). Para el aviso, puso toda la normativa en el contexto (128K tokens) y obtuvo 20 respuestas correctas en total, pero sufrió del 'Perdido en el Medio' y de alta latencia. Para RAG, utilizó fragmentación (500 tokens con solapamiento), incrustaciones BAAI/bge-m3 y Qdrant como base de datos vectorial, recuperando los 5 fragmentos principales. RAG logró 9/10 en preguntas factuales y proporcionó referencias de fuentes, pero falló en preguntas sintéticas y no pudo aprender terminología interna. Para QLoRA, generó alrededor de 800 pares de preguntas y respuestas con un modelo más fuerte, los limpió manualmente y entrenó un adaptador LoRA durante unos 40 minutos. El modelo ajustado destacó en preguntas de formato (10/10) y mejoró en preguntas sintéticas (8/10), pero falló en hechos actualizados, respondiendo con límites antiguos del conjunto de datos. El autor concluye que estos enfoques no son competidores sino capas: comienza con avisos, luego agrega RAG para precisión factual y referencias de fuentes, y usa ajuste fino cuando necesitas que el modelo adopte un estilo o terminología específica. El estudio también menciona que Unsloth Studio y H2O LLM Studio ofrecen ajuste fino basado en GUI, y la investigación LoRA Land de Predibase mostró que los modelos ajustados pueden superar a GPT-4 en tareas específicas.
Fuente: Habr — хаб ИИ —
original
