Economia com LLMs: Modelo Chinês Inesperadamente Começa a Escrever em Caracteres Chineses
Tencent
DeepSeek
Um bot agregador de notícias de IA mudou para um modelo chinês mais barato (ling-2.6-flash) que custa 8 vezes menos, mas descobriu que o modelo frequentemente gera caracteres chineses na saída em russo. O desenvolvedor adicionou uma detecção de caracteres CJK e um fallback para um modelo mais caro para limpeza, resultando em uma economia líquida de cerca de 42%.
Um desenvolvedor que opera um bot de feed de notícias bilíngue, fazendo cerca de 936 chamadas de LLM por dia, buscou modelos mais baratos no OpenRouter. Dos 17 modelos gratuitos, apenas 3 eram utilizáveis e apresentavam problemas como lentidão ou falta de suporte a JSON. O desenvolvedor então encontrou o modelo chinês pago inclusionai/ling-2.6-flash a US$ 0,010 por milhão de tokens de entrada, que é 8 vezes mais barato e 4 vezes mais rápido que o deepseek-v4-flash (US$ 0,098) usado anteriormente. No entanto, após a implantação, o bot começou a gerar caracteres chineses em manchetes de notícias russas. Testes mostraram que 17% dos resumos curtos e 57% das análises longas continham texto chinês. A solução foi adicionar um detector de regex para CJK (Chinês, Japonês e Coreano): se caracteres chineses fossem encontrados, a mesma requisição era reenviada para o modelo limpo deepseek-v4-flash. Após o ajuste, a contaminação caiu para 0% (0 de 8). O desenvolvedor também aprendeu três lições inesperadas: os custos são impulsionados pelas fontes de notícias, não pelo número de usuários; os modelos gratuitos param de funcionar quando o saldo da conta fica negativo, mesmo para modelos que custam US$ 0; e a ausência do parâmetro max_tokens causa reservas enormes de tokens. O pipeline final usa ling-2.6-flash como primário, deepseek-v4-flash como fallback para limpeza de CJK e gemma:free como último recurso. Os custos mensais caíram de US$ 14,8 para aproximadamente US$ 8,6, uma economia de 42%, em vez dos 8x esperados, devido ao pagamento duplo pelas análises longas.
Fonte: Habr — хаб ML —
original
