Einsparungen bei LLMs: Chinesisches Modell schreibt unerwartet in chinesischen Schriftzeichen
Tencent
DeepSeek
Ein KI-Nachrichtenaggregator-Bot wechselte zu einem günstigeren chinesischen Modell (ling-2.6-flash), das 8-mal weniger kostet, stellte jedoch fest, dass das Modell oft chinesische Zeichen in der russischen Ausgabe generiert. Der Entwickler fügte eine CJK-Erkennung und einen Fallback auf ein teureres Modell zur Bereinigung hinzu, was zu einer Nettoreduktion von etwa 42 % führte.
Ein Entwickler, der einen zweisprachigen News-Feed-Bot betreibt, der etwa 936 LLM-Anfragen pro Tag stellt, suchte auf OpenRouter nach günstigeren Modellen. Von 17 kostenlosen Modellen waren nur 3 nutzbar, und diese hatten Probleme wie Langsamkeit oder fehlende JSON-Unterstützung. Der Entwickler fand dann das kostenpflichtige chinesische Modell inclusionai/ling-2.6-flash für 0,010 Dollar pro Million Input-Token, das achtmal günstiger und viermal schneller ist als das zuvor verwendete deepseek-v4-flash (0,098 Dollar). Nach dem Deployment begann der Bot jedoch, chinesische Schriftzeichen in russischen Schlagzeilen auszugeben. Tests ergaben, dass 17 % der kurzen Zusammenfassungen und 57 % der langen Analysen chinesischen Text enthielten. Die Lösung war das Hinzufügen eines CJK-Regex-Detektors: Wenn chinesische Zeichen gefunden wurden, wurde dieselbe Anfrage erneut an das saubere deepseek-v4-flash-Modell gesendet. Nach der Behebung sank die Kontamination auf 0 % (0 von 8). Der Entwickler lernte auch drei unerwartete Lektionen: Die Kosten werden von den Nachrichtenquellen bestimmt, nicht von der Nutzeranzahl; kostenlose Modelle funktionieren nicht mehr, wenn das Kontoguthaben negativ wird, selbst für Modelle mit 0 Dollar; und das Fehlen des max_tokens-Parameters führt zu riesigen Token-Reservierungen. Die endgültige Pipeline verwendet ling-2.6-flash als primäres Modell, deepseek-v4-flash als Fallback für CJK-Bereinigung und gemma:free als letzte Option. Die monatlichen Kosten sanken von 14,80 Dollar auf etwa 8,60 Dollar, eine Ersparnis von 42 % statt der erwarteten Achtfachen, aufgrund der doppelten Zahlung für lange Analysen.
Quelle: Habr — хаб ML —
Original
