Saving on LLM: Chinese Model Unexpectedly Started Writing in Chinese Characters
Tencent
DeepSeek
A developer of a bilingual news bot decided to switch to a cheaper AI model: Ling 2.6 Flash by Inclusion AI costs 8 times less than DeepSeek V4 Flash and runs 4 times faster. However, after an hour of use, Chinese characters appeared in the feed: the model periodically reverted to its native Chinese language, especially on longer generations. The problem was solved by adding a Chinese character detector with a re-query to the clean model.
Автор новости ведет двуязычную ленту новостей, где каждая новость проходит через LLM (около 936 вызовов в сутки) для категоризации, перевода, тона и разбора. С целью экономии он перебрал бесплатные модели OpenRouter, но большинство оказались недоступны из-за политик данных, а работающие были слишком медленными. Затем он протестировал дешёвую платную модель inclusionai/ling-2.6-flash ($0.010 за млн входных токенов против $0.098 у deepseek-v4-flash). На реальных промптах она показала такое же качество (4/4 по категориям, 6/6 по разбору), скорость 2.4 с (против 10 с) и была в 8 раз дешевле. Однако через час в ленте появился заголовок с китайскими иероглифами и знаками пунктуации. Выяснилось, что модель китайская: на коротких выводах иероглифы появлялись в 17% случаев, на длинных разборах — в 57%, тогда как DeepSeek V4 Flash не давал ошибок. Автор добавил детектор иероглифов (регулярное выражение для символов CJK) и переспрос к «чистой» модели DeepSeek V4 Flash, что свело утечки к нулю. Теперь цепочка такова: Ling 2.6 Flash — основной, DeepSeek V4 Flash — подчищает иероглифы, Gemma:free — страхует на случай отказа провайдера. Итоговая экономия составляет около $8.6 в месяц против $14.8 на чистом DeepSeek, но оказалась меньше ожидаемой из-за двойной оплаты 57% длинных разборов. Главный вывод: дешёвая модель может быть отличной по замеренным метрикам, но провалиться там, где автор не додумался проверить — в данном случае, на языке ответа.
Nguồn: Habr — хаб ML —
bản gốc
