Saving on LLM: Chinese Model Unexpectedly Started Writing in Chinese Characters
Tencent
DeepSeek
A developer of a bilingual news bot decided to switch to a cheaper AI model: Ling 2.6 Flash by Inclusion AI costs 8 times less than DeepSeek V4 Flash and runs 4 times faster. However, after an hour of use, Chinese characters appeared in the feed: the model periodically reverted to its native Chinese language, especially on longer generations. The problem was solved by adding a Chinese character detector with a re-query to the clean model.
Penulis berita ini menjalankan saluran berita dwibahasa, di mana setiap berita diproses melalui LLM (sekitar 936 panggilan per hari) untuk kategorisasi, terjemahan, analisis sentimen, dan penguraian. Demi menghemat biaya, ia mencoba model gratis OpenRouter, tetapi sebagian besar tidak tersedia karena kebijakan data, dan yang berfungsi terlalu lambat. Kemudian ia menguji model berbayar murah inclusionai/ling-2.6-flash ($0,010 per juta token input dibandingkan dengan $0,098 untuk deepseek-v4-flash). Pada prompt nyata, model ini menunjukkan kualitas yang sama (4/4 untuk kategori, 6/6 untuk penguraian), kecepatan 2,4 detik (dibandingkan 10 detik), dan delapan kali lebih murah. Namun, satu jam kemudian, muncul judul dengan aksara dan tanda baca Mandarin. Ternyata model tersebut buatan China: pada output pendek, aksara Mandarin muncul dalam 17% kasus, pada penguraian panjang dalam 57% kasus, sementara DeepSeek V4 Flash tidak memberikan kesalahan. Penulis menambahkan detektor aksara Mandarin (ekspresi reguler untuk karakter CJK) dan meminta ulang ke model 'bersih' DeepSeek V4 Flash, sehingga kebocoran menjadi nol. Kini rangkaiannya adalah: Ling 2.6 Flash sebagai model utama, DeepSeek V4 Flash membersihkan aksara Mandarin, dan Gemma:free sebagai cadangan jika penyedia gagal. Penghematan akhir sekitar $8,6 per bulan dibandingkan $14,8 dengan DeepSeek murni, tetapi ternyata lebih kecil dari yang diharapkan karena pembayaran ganda untuk 57% penguraian panjang. Kesimpulan utama: model murah bisa sangat baik dalam metrik yang diukur, tetapi gagal di area yang tidak terpikirkan oleh penulis untuk diperiksa—dalam hal ini, bahasa output.
Sumber: Habr — хаб ML —
asli
