LLM'lerde Tasarruf: Çin Modeli Beklenmedik Şekilde Çince Karakterlerle Yazmaya Başladı
Tencent
DeepSeek
Bir AI haber toplayıcı botu, 8 kat daha ucuza mal olan daha ucuz bir Çin modeline (ling-2.6-flash) geçti, ancak modelin Rusça çıktıda sık sık Çince karakterler ürettiğini keşfetti. Geliştirici, bir CJK tespiti ve temizlik için daha pahalı bir modele geçiş ekleyerek nette yaklaşık %42 tasarruf sağladı.
İki dilli bir haber akışı botu çalıştıran ve günde yaklaşık 936 büyük dil modeli (LLM) çağrısı yapan bir geliştirici, OpenRouter'da daha ucuz modeller aradı. 17 ücretsiz modelden sadece 3'ü kullanılabilirdi ve bunların da hız veya JSON desteği eksikliği gibi sorunları vardı. Geliştirici daha sonra ücretli Çin modeli inclusionai/ling-2.6-flash'i milyon girdi token başına 0,010 dolara buldu; bu, daha önce kullanılan deepseek-v4-flash'ten (0,098 dolar) 8 kat daha ucuz ve 4 kat daha hızlıydı. Ancak dağıtımdan sonra bot, Rusça haber başlıklarında Çince karakterler üretmeye başladı. Testler, kısa özetlerin %17'sinin ve uzun analizlerin %57'sinin Çince metin içerdiğini gösterdi. Çözüm, bir CJK (Çince, Japonca, Korece) regex dedektörü eklemekti: Çince karakterler bulunursa, aynı istek temiz deepseek-v4-flash modeline yeniden gönderiliyordu. Düzeltmeden sonra, kirlenme (8 üzerinden 0 ile) %0'a düştü. Geliştirici ayrıca beklenmedik üç ders öğrendi: maliyetler kullanıcı sayısından değil, haber kaynaklarından kaynaklanıyor; ücretsiz modeller, hesap bakiyesi sıfırın altına düştüğünde, 0 dolarlık modeller için bile çalışmayı durduruyor; ve eksik max_tokens parametresi devasa token rezervasyonlarına neden oluyor. Nihai iş akışı, birincil olarak ling-2.6-flash, CJK temizliği için yedek olarak deepseek-v4-flash ve son çare olarak gemma:free kullanıyor. Aylık maliyetler, uzun analizler için çifte ödeme nedeniyle beklenen 8 kat yerine %42 tasarrufla 14,8 dolardan yaklaşık 8,6 dolara düştü.
Kaynak: Habr — хаб ML —
orijinal
