ModelosNegócios e Mercado 🇷🇺 27.07.2026 04:03

Economizando no LLM: Modelo Chinês Inesperadamente Começou a Escrever em Caracteres Chineses

TencentTencent DeepSeekDeepSeek
Um desenvolvedor de um bot de notícias bilíngue decidiu mudar para um modelo de IA mais barato: o Ling 2.6 Flash da Inclusion AI custa 8 vezes menos que o DeepSeek V4 Flash e roda 4 vezes mais rápido. No entanto, após uma hora de uso, caracteres chineses apareceram no feed: o modelo periodicamente revertia para sua língua nativa chinesa, especialmente em gerações mais longas. O problema foi resolvido adicionando um detector de caracteres chineses com uma nova consulta ao modelo limpo.
O autor da notícia mantém um feed de notícias bilíngue, onde cada notícia passa por um LLM (cerca de 936 chamadas por dia) para categorização, tradução, tom e análise. Visando economia, ele testou modelos gratuitos do OpenRouter, mas a maioria estava indisponível devido a políticas de dados, e os que funcionavam eram muito lentos. Em seguida, testou um modelo pago barato, o inclusionai/ling-2.6-flash ($0,010 por milhão de tokens de entrada contra $0,098 do deepseek-v4-flash). Em prompts reais, ele mostrou a mesma qualidade (4/4 em categorias, 6/6 em análise), velocidade de 2,4 segundos (contra 10 segundos) e foi 8 vezes mais barato. No entanto, uma hora depois, apareceu no feed um título com caracteres chineses e pontuação. Descobriu-se que o modelo é chinês: em saídas curtas, os caracteres apareciam em 17% dos casos; em análises longas, em 57%, enquanto o DeepSeek V4 Flash não apresentava erros. O autor adicionou um detector de caracteres (expressão regular para símbolos CJK) e uma nova consulta ao modelo "limpo" DeepSeek V4 Flash, reduzindo os vazamentos a zero. Agora, a cadeia é: Ling 2.6 Flash como principal, DeepSeek V4 Flash para limpeza de caracteres, e Gemma:free como backup em caso de falha do provedor. A economia final é de cerca de $8,6 por mês, contra $14,8 com DeepSeek puro, mas foi menor do que o esperado devido à dupla cobrança de 57% das análises longas. A principal conclusão: um modelo barato pode ser excelente nas métricas medidas, mas falhar onde o autor não pensou em verificar — neste caso, no idioma da resposta.
Fonte: Habr — хаб ML — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas