Negocios y MercadoCódigo Abierto 🇷🇺 27.07.2026 04:03

Ahorros en LLMs: Modelo chino inesperadamente empieza a escribir en caracteres chinos

TencentTencent DeepSeekDeepSeek
Un robot agregador de noticias de IA cambió a un modelo chino más barato (ling-2.6-flash) que cuesta 8 veces menos, pero descubrió que el modelo genera a menudo caracteres chinos en la salida en ruso. El desarrollador añadió una detección de caracteres CJK y un recurso a un modelo más caro para la limpieza, lo que generó un ahorro neto de aproximadamente el 42%.
Un desarrollador que ejecuta un bot de noticias bilingüe que realiza aproximadamente 936 llamadas a modelos de lenguaje grandes (LLM, por sus siglas en inglés) por día buscó modelos más baratos en OpenRouter. De 17 modelos gratuitos, solo 3 eran utilizables, y tenían problemas como velocidad o falta de compatibilidad con JSON. El desarrollador encontró entonces el modelo chino de pago inclusionai/ling-2.6-flash a 0,010 dólares por millón de tokens de entrada, que es 8 veces más barato y 4 veces más rápido que el deepseek-v4-flash utilizado anteriormente (0,098 dólares). Sin embargo, después del despliegue, el bot comenzó a generar caracteres chinos en titulares de noticias rusas. Las pruebas mostraron que el 17 % de los resúmenes cortos y el 57 % de los análisis largos contenían texto en chino. La solución fue agregar un detector de expresiones regulares para caracteres CJK (chino, japonés y coreano, por sus siglas en inglés): si se encontraban caracteres chinos, la misma solicitud se reenviaba al modelo limpio deepseek-v4-flash. Después de la corrección, la contaminación se redujo al 0 % (0 de 8). El desarrollador también aprendió tres lecciones inesperadas: los costos están impulsados por las fuentes de noticias, no por el número de usuarios; los modelos gratuitos dejan de funcionar cuando el saldo de la cuenta es negativo, incluso para modelos de 0 dólares; y la falta del parámetro max_tokens provoca enormes reservas de tokens. El pipeline final utiliza ling-2.6-flash como modelo principal, deepseek-v4-flash como respaldo para la limpieza de caracteres CJK, y gemma:free como último recurso. Los costos mensuales bajaron de 14,8 dólares a aproximadamente 8,6 dólares, un ahorro del 42 % en lugar del esperado 8 veces debido al doble pago por los análisis largos.
Fuente: Habr — хаб ML — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas