क्लॉड और GPT को खिलाना बंद करें: अपना स्वयं का ऑन-प्रिमाइसेस LLM कैसे स्थापित करें
OpenAI
Anthropic
Alibaba/Qwen
कर्मचारी तेजी से संवेदनशील कॉर्पोरेट डेटा को बाहरी AI टूल्स में लीक कर रहे हैं, जिसे शैडो AI के रूप में जाना जाता है। पूरी तरह से प्रतिबंध लगाने के बजाय, विशेषज्ञ ऑन-प्रिमाइसेस विकल्प पेश करने का सुझाव देते हैं। हालांकि, क्लाउड में GPU किराए पर लेना वास्तविक अलगाव नहीं है। यह लेख जोखिमों, विभिन्न तैनाती विकल्पों की तुलना, और एक आंतरिक मॉडल चलाने के लिए व्यावहारिक मार्गदर्शन की व्याख्या करता है।
शैडो AI, जहां कर्मचारी अनधिकृत AI टूल्स का उपयोग करते हैं, एक बढ़ती हुई समस्या है। ISACA के एक सर्वेक्षण में पाया गया कि 90% IT ऑडिटर कर्मचारियों को AI का उपयोग करते देखते हैं, लेकिन केवल 38% संगठनों के पास नीतियां हैं। Verizon की DBIR रिपोर्ट दिखाती है कि शैडो AI तीसरी सबसे आम अनजाने में की गई अंदरूनी कार्रवाई है, जिसमें सालाना चार गुना वृद्धि हुई है। सोर्स कोड और छवियां सबसे अधिक लीक होने वाला डेटा हैं। कई घटनाओं के बाद Samsung का 2023 में ChatGPT पर प्रतिबंध निषेध की अप्रभावीता को दर्शाता है, क्योंकि यह केवल उपयोग को भूमिगत कर देता है। शून्य डेटा प्रतिधारण वाले एंटरप्राइज़ API खरीदना भी अपर्याप्त है क्योंकि प्रॉम्प्ट अभी भी प्रदाता को दिखाई देते हैं, और अदालतों ने OpenAI को लॉग सौंपने के लिए मजबूर किया है। लेख चेतावनी देता है कि क्लाउड में साझा या समर्पित GPU किराए पर लेना भी पूर्ण समाधान नहीं है, CVE-2026-46229 जैसी कमजोरियों का हवाला देते हुए जहां VRAM टेनेंट के बीच लीक हो सकता है, और हाइपरवाइज़र सब कुछ देख सकते हैं। अधिकांश कॉर्पोरेट आवश्यकताओं के लिए, समर्पित बेयर-मेटल होस्टिंग पर्याप्त है, लेकिन उच्चतम सुरक्षा के लिए, स्वयं के हार्डवेयर की आवश्यकता होती है। लेख नियमित कार्यों के लिए Qwen3-32B जैसे सरल मॉडल से शुरुआत करने, छोटे उपयोगकर्ता संख्या के लिए Ollama या भारी लोड के लिए vLLM उपयोग करने, और SSO और ऑडिटिंग के लिए गेटवे के रूप में LiteLLM के साथ फ्रंटिंग करने का सुझाव देता है। लागत-समतुल्यता बिंदु लगभग 2 मिलियन टोकन प्रति दिन है, जिसके बाद ऑन-प्रिमाइस अधिक किफायती है।
स्रोत: Habr — хаб ИИ —
मूल
