Bedrijf & MarktOpen Source 🇷🇺 27.07.2026 04:03

Besparingen op LLM's: Chinees model begint onverwacht in Chinese karakters te schrijven

TencentTencent DeepSeekDeepSeek
Een AI-nieuwsaggregator-bot schakelde over op een goedkoper Chinees model (ling-2.6-flash) dat 8x minder kost, maar ontdekte dat het model vaak Chinese karakters in Russische uitvoer genereert. De ontwikkelaar voegde een CJK-detectie en fallback naar een duurder model voor opschoning toe, wat leidde tot een netto besparing van ongeveer 42%.
Een ontwikkelaar die een tweetalige nieuwsfeedbot draait die ongeveer 936 LLM-aanroepen per dag doet, zocht op OpenRouter naar goedkopere modellen. Van de 17 gratis modellen waren er slechts 3 bruikbaar, en die hadden problemen zoals snelheid of gebrek aan JSON-ondersteuning. De ontwikkelaar vond toen het betaalde Chinese model inclusionai/ling-2.6-flash voor $0,010 per miljoen invoertokens, wat 8x goedkoper en 4x sneller is dan het eerder gebruikte deepseek-v4-flash ($0,098). Na implementatie begon de bot echter Chinese karakters in Russische nieuwskoppen te plaatsen. Tests lieten zien dat 17% van de korte samenvattingen en 57% van de lange analyses Chinese tekst bevatten. De oplossing was het toevoegen van een CJK-regexdetector: als er Chinese karakters werden gevonden, werd hetzelfde verzoek opnieuw naar het schone deepseek-v4-flash-model gestuurd. Na de reparatie daalde de contaminatie naar 0% (0 van de 8). De ontwikkelaar leerde ook drie onverwachte lessen: kosten worden gedreven door nieuwsbronnen, niet door het aantal gebruikers; gratis modellen stoppen met werken wanneer het accountsaldo negatief wordt, zelfs voor modellen van $0; en het ontbreken van de parameter max_tokens leidt tot enorme tokenreserveringen. De uiteindelijke pijplijn gebruikt ling-2.6-flash als primair model, deepseek-v4-flash als fallback voor CJK-opschoning en gemma:free als laatste redmiddel. De maandelijkse kosten daalden van $14,8 naar ongeveer $8,6, een besparing van 42% in plaats van de verwachte 8x vanwege de dubbele betaling voor lange analyses.
Bron: Habr — хаб ML — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws