ModellenBedrijf & Markt 🇷🇺 27.07.2026 04:03

Besparen op LLM: Chinees Model Schreef Onverwacht in Chinese Karakters

TencentTencent DeepSeekDeepSeek
Een ontwikkelaar van een tweetalige nieuwsbot besloot over te stappen op een goedkoper AI-model: Ling 2.6 Flash van Inclusion AI kost 8 keer minder dan DeepSeek V4 Flash en draait 4 keer sneller. Na een uur gebruik verschenen er echter Chinese karakters in de feed: het model viel periodiek terug op zijn moedertaal Chinees, vooral bij langere generaties. Het probleem werd opgelost door een Chinese karakterdetector toe te voegen met een herhaalde query naar het schone model.
De auteur van het nieuws beheert een tweetalige nieuwsfeed, waarbij elk bericht door een LLM gaat (ongeveer 936 aanroepen per dag) voor categorisatie, vertaling, toon en analyse. Om kosten te besparen, probeerde hij gratis modellen van OpenRouter, maar de meeste waren niet beschikbaar vanwege databeleid, en de werkende waren te traag. Vervolgens testte hij het goedkope betaalde model inclusionai/ling-2.6-flash ($0,010 per miljoen inputtokens tegenover $0,098 voor deepseek-v4-flash). Op echte prompts toonde het dezelfde kwaliteit (4/4 voor categorieën, 6/6 voor analyse), een snelheid van 2,4 seconden (tegenover 10 seconden) en was het 8 keer goedkoper. Na een uur verscheen er echter een kop met Chinese karakters en leestekens in de feed. Het bleek dat het model Chinees was: bij korte uitvoer verschenen karakters in 17% van de gevallen, bij lange analyses in 57%, terwijl DeepSeek V4 Flash geen fouten gaf. De auteur voegde een karaktersdetector toe (een reguliere expressie voor CJK-tekens) en een herhaalde aanvraag aan het 'schone' model DeepSeek V4 Flash, waardoor lekken tot nul werden teruggebracht. De keten is nu: Ling 2.6 Flash als primair, DeepSeek V4 Flash voor het opschonen van karakters, en Gemma:free als back-up voor het geval de provider uitvalt. De uiteindelijke besparing bedraagt ongeveer $8,60 per maand tegenover $14,80 voor alleen DeepSeek, maar bleek kleiner dan verwacht vanwege dubbele betaling voor 57% van de lange analyses. De belangrijkste conclusie: een goedkoop model kan uitstekend zijn op gemeten metrieken, maar faalt waar de auteur niet aan dacht te testen – in dit geval op de taal van de uitvoer.
Bron: Habr — хаб ML — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws