Sparen beim LLM: Chinesisches Modell schrieb plötzlich auf Chinesisch
Tencent
DeepSeek
Ein Entwickler eines zweisprachigen News-Bots entschied sich für ein günstigeres KI-Modell: Ling 2.6 Flash von Inclusion AI kostet 8-mal weniger als DeepSeek V4 Flash und läuft 4-mal schneller. Nach einer Stunde Nutzung tauchten jedoch chinesische Schriftzeichen im Feed auf: Das Modell wechselte periodisch zurück in seine Muttersprache Chinesisch, besonders bei längeren Generierungen. Das Problem wurde gelöst, indem ein Detektor für chinesische Zeichen mit einer erneuten Abfrage des sauberen Modells hinzugefügt wurde.
Der Autor des Newsletters betreibt einen zweisprachigen Newsfeed, wobei jede Meldung durch ein LLM (etwa 936 Aufrufe pro Tag) zur Kategorisierung, Übersetzung, Tonalität und Analyse läuft. Um Geld zu sparen, probierte er kostenlose Modelle von OpenRouter aus, aber die meisten waren aufgrund von Datenrichtlinien nicht verfügbar, und die funktionierenden waren zu langsam. Anschließend testete er das günstige kostenpflichtige Modell inclusionai/ling-2.6-flash (0,010 USD pro Million Input-Tokens gegenüber 0,098 USD bei deepseek-v4-flash). Bei realen Prompts zeigte es die gleiche Qualität (4/4 bei Kategorien, 6/6 bei Analyse), eine Geschwindigkeit von 2,4 Sekunden (gegenüber 10 Sekunden) und war 8-mal günstiger. Nach einer Stunde tauchte jedoch im Feed eine Überschrift mit chinesischen Schriftzeichen und Satzzeichen auf. Es stellte sich heraus, dass das Modell chinesisch ist: Bei kurzen Ausgaben traten chinesische Zeichen in 17 % der Fälle auf, bei langen Analysen in 57 %, während DeepSeek V4 Flash keine derartigen Fehler produzierte. Der Autor fügte einen Detektor für chinesische Zeichen (regulärer Ausdruck für CJK-Zeichen) und eine Rückfrage an das „saubere“ Modell DeepSeek V4 Flash hinzu, was die Ausfälle auf null reduzierte. Die Kette sieht nun so aus: Ling 2.6 Flash als Hauptmodell, DeepSeek V4 Flash zur Bereinigung chinesischer Zeichen, Gemma:free als Backup für den Fall eines Provider-Ausfalls. Die resultierende Einsparung beträgt etwa 8,6 USD pro Monat gegenüber 14,8 USD bei reinem DeepSeek, fiel aber aufgrund der doppelten Bezahlung für 57 % der langen Analysen geringer aus als erwartet. Die wichtigste Erkenntnis: Ein billiges Modell kann in den gemessenen Metriken hervorragend sein, aber dort scheitern, wo der Autor nicht daran dachte zu prüfen – in diesem Fall bei der Ausgabesprache.
Quelle: Habr — хаб ML —
Original
