Ahorrando en LLM: Modelo chino inesperadamente empezó a escribir en caracteres chinos
Tencent
DeepSeek
Un desarrollador de un bot de noticias bilingüe decidió cambiar a un modelo de IA más barato: Ling 2.6 Flash de Inclusion AI cuesta 8 veces menos que DeepSeek V4 Flash y funciona 4 veces más rápido. Sin embargo, después de una hora de uso, aparecieron caracteres chinos en el feed: el modelo volvía periódicamente a su idioma nativo chino, especialmente en generaciones más largas. El problema se resolvió añadiendo un detector de caracteres chinos con una nueva consulta al modelo limpio.
El autor de la noticia gestiona un feed bilingüe de noticias, donde cada noticia pasa por un LLM (aproximadamente 936 llamadas al día) para categorización, traducción, tono y análisis. Para ahorrar costos, probó los modelos gratuitos de OpenRouter, pero la mayoría no estaban disponibles debido a políticas de datos, y los que funcionaban eran demasiado lentos. Luego probó un modelo pago económico, inclusionai/ling-2.6-flash ($0.010 por millón de tokens de entrada frente a $0.098 de deepseek-v4-flash). En prompts reales, mostró la misma calidad (4/4 en categorías, 6/6 en análisis), velocidad de 2.4 s (frente a 10 s) y era 8 veces más barato. Sin embargo, una hora después apareció en el feed un titular con caracteres chinos y signos de puntuación. Resultó que el modelo es chino: en salidas cortas, los caracteres aparecían en un 17% de los casos, en análisis largos en un 57%, mientras que DeepSeek V4 Flash no daba errores. El autor añadió un detector de caracteres (expresión regular para símbolos CJK) y una reconsulta al modelo "limpio" DeepSeek V4 Flash, reduciendo las fugas a cero. Ahora la cadena es: Ling 2.6 Flash como principal, DeepSeek V4 Flash para limpiar caracteres, y Gemma:free como respaldo en caso de fallo del proveedor. El ahorro final es de aproximadamente $8.6 al mes frente a $14.8 usando solo DeepSeek, pero resultó menor de lo esperado debido al doble pago del 57% de los análisis largos. La conclusión principal: un modelo barato puede ser excelente en las métricas medidas, pero fallar donde el autor no pensó en verificar: en este caso, en el idioma de la respuesta.
Fuente: Habr — хаб ML —
original
