अमेज़न SageMaker पायथन SDK में LLM ऑप्टिमाइज़ेशन टूल्स का एकीकरण

Amazon Web ServicesAmazon Web Services
अमेज़न SageMaker पायथन SDK v3 में अब जनरेटिव AI इंफ़रेंस अनुशंसाएँ शामिल हैं, जो उपयोगकर्ताओं को एंडपॉइंट्स का बेंचमार्क करने, डिप्लॉयमेंट अनुशंसाएँ उत्पन्न करने और सीधे नोटबुक्स से डिप्लॉय करने की सुविधा देता है। ये नई क्षमताएँ, जो sagemaker.serve.ai_inference_recommender पैकेज के अंतर्गत उपलब्ध हैं, इंफ़रेंस ऑप्टिमाइज़ेशन को स्वचालित करती हैं और मौजूदा वर्कफ़्लो के साथ एकीकृत होती हैं।
अमेज़न सेजमेकर पायथन एसडीके v3 में जनरेटिव एआई अनुमान सिफारिशें शामिल की गई हैं, जो उपयोगकर्ताओं को बड़े भाषा मॉडल के तैनाती को अनुकूलित करने में सक्षम बनाती हैं। यह सेवा वास्तविक या सिंथेटिक ट्रैफ़िक के विरुद्ध लाइव एंडपॉइंट्स का बेंचमार्क करती है, थ्रूपुट, पहले-टोकन-का-समय (टीटीएफटी), और विलंबता को मापती है, और लागत-प्रदर्शन ट्रेड-ऑफ़ के आधार पर क्रमबद्ध तैनाती सिफारिशें उत्पन्न करती है। उपयोगकर्ता शीर्ष-क्रम वाले कॉन्फ़िगरेशन को सीधे अमेज़न सेजमेकर रीयल-टाइम एंडपॉइंट पर तैनात कर सकते हैं। नया एसडीके इंटरफ़ेस, जो sagemaker.serve.ai_inference_recommender पैकेज में संस्करण 3.17.0 से उपलब्ध है, में ModelBuilder.from_jumpstart_config, start_benchmark, generate_deployment_recommendations, और deploy जैसे ऑपरेशन शामिल हैं। पोस्ट एक अंत-से-अंत वर्कफ़्लो प्रदर्शित करता है: सिफारिशें उत्पन्न करना, परिणामों की व्याख्या करना, तैनात करना, बेंचमार्क करना, और LMI और vLLM जैसे फ्रेमवर्क की तुलना करना। यह यह भी बताता है कि प्रमुख मैट्रिक्स को कैसे पढ़ें और प्रदर्शन लक्ष्यों के आधार पर कॉन्फ़िगरेशन के बीच चयन कैसे करें, और ModelBuilder.from_recommendation_job का उपयोग करके पहले से चलाए गए सिफारिश कार्य से तैनाती कैसे करें।
स्रोत: AWS ML blog — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार