एलएलएम पर बचत: चीनी मॉडल अप्रत्याशित रूप से चीनी अक्षरों में लिखने लगा

TencentTencent DeepSeekDeepSeek
एक एआई समाचार एग्रीगेटर बॉट ने 8 गुना सस्ते चीनी मॉडल (ling-2.6-flash) पर स्विच किया, लेकिन पाया कि मॉडल अक्सर रूसी आउटपुट में चीनी अक्षर उत्पन्न करता है। डेवलपर ने CJK डिटेक्शन जोड़ा और सफाई के लिए अधिक महंगे मॉडल पर फ़ॉलबैक किया, जिससे लगभग 42% की शुद्ध बचत हुई।
एक डेवलपर जो द्विभाषी समाचार फ़ीड बॉट चला रहा है और प्रतिदिन लगभग 936 LLM कॉल करता है, उसने OpenRouter पर सस्ते मॉडल खोजे। 17 मुफ्त मॉडलों में से केवल 3 उपयोग करने योग्य थे, और उनमें गति या JSON समर्थन की कमी जैसी समस्याएँ थीं। फिर डेवलपर को पेड चीनी मॉडल inclusionai/ling-2.6-flash मिला, जिसकी कीमत $0.010 प्रति मिलियन इनपुट टोकन है, जो पहले उपयोग किए गए deepseek-v4-flash ($0.098) से 8 गुना सस्ता और 4 गुना तेज़ है। हालांकि, तैनाती के बाद, बॉट रूसी समाचार शीर्षकों में चीनी अक्षर आउटपुट करने लगा। परीक्षण में पाया गया कि 17% छोटे सारांश और 57% लंबे विश्लेषणों में चीनी टेक्स्ट था। समाधान एक CJK रेगेक्स डिटेक्टर जोड़ना था: यदि चीनी अक्षर मिलते हैं, तो उसी अनुरोध को साफ deepseek-v4-flash मॉडल पर फिर से भेज दिया जाता है। ठीक करने के बाद, संदूषण घटकर 0% (8 में से 0) हो गया। डेवलपर ने तीन अप्रत्याशित सबक भी सीखे: लागत उपयोगकर्ता संख्या से नहीं, बल्कि समाचार स्रोतों से प्रेरित होती है; मुफ्त मॉडल तब काम करना बंद कर देते हैं जब खाता शेष शून्य से नीचे चला जाता है, भले ही वे $0 मॉडल हों; और max_tokens पैरामीटर गायब होने पर बड़े टोकन आरक्षण होते हैं। अंतिम पाइपलाइन में ling-2.6-flash प्राथमिक, CJK सफाई के लिए deepseek-v4-flash फ़ॉलबैक, और अंतिम विकल्प के रूप में gemma:free का उपयोग होता है। मासिक लागत $14.8 से घटकर लगभग $8.6 हो गई, जो लंबे विश्लेषणों के लिए दोहरे भुगतान के कारण अपेक्षित 8 गुना के बजाय 42% की बचत है।
स्रोत: Habr — хаб ML — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार