लोड पर हाइब्रिड ट्रांसफॉर्मर: जहां गेटेड डेल्टानेट पूर्ण अटेंशन से हार जाता है

एक इंजीनियर ने RTX 3090 पर एजेंटिक लोड के तहत दो Qwen मॉडलों का परीक्षण किया, एक पूर्ण अटेंशन के साथ और एक हाइब्रिड आर्किटेक्चर के साथ जो गेटेड डेल्टानेट का उपयोग करता है। हाइब्रिड मॉडल लंबे संदर्भ और उच्च समवर्तीता में जीतता है, लेकिन साझा सिस्टम प्रॉम्प्ट वाले छोटे संवादों में हार जाता है। मुख्य समस्या कैश ब्लॉक आकार का 528 टोकन तक बढ़ना है, जिससे प्रीफिक्स कैश हिट दर घट जाती है और प्रॉम्प्ट के एक तिहाई हिस्से की पुनर्गणना करने के लिए मजबूर होना पड़ता है।
हाइब्रिड मॉडल Qwen3.5-4B में 32 परतों में से केवल 8 में पूर्ण अटेंशन का उपयोग होता है, जबकि 24 आवर्ती गेटेड डेल्टानेट परतें एक निश्चित आकार की स्थिति बनाए रखती हैं, जिससे ग्रोइंग केवी कैश के बजाय स्थिर आकार की स्थिति बनी रहती है। एकल RTX 3090 पर vLLM 0.26.0 के साथ सिंथेटिक एजेंटिक लोड के तहत, हाइब्रिड ने 84% प्रीफिक्स कैश हिट दिखाई, जबकि पूर्ण अटेंशन Qwen3-4B के लिए यह 94% था, और तीन गुना अधिक प्रॉम्प्ट टोकन की पुनर्गणना की। मूल कारण यह है कि रिकरेंट स्टेट पेज और अटेंशन केवी पेज एक सामान्य पूल साझा करते हैं, जिससे अटेंशन पेज का आकार स्टेट पेज के आकार से मेल खाने के लिए मजबूर होता है, जिससे ब्लॉक साइज़ 16 टोकन से बढ़कर 528 टोकन हो जाता है। इससे प्रीफिक्स मिलान की ग्रैन्युलैरिटी कम हो जाती है और पुनर्गणना बढ़ जाती है। हालांकि हाइब्रिड की प्रभावी कैश क्षमता 3.2 गुना अधिक है (297,720 टोकन बनाम 93,408), लेकिन इसके लिए कैश के लिए 2.6 GiB कम मेमोरी और 2.3 गुना बड़े एक्टिवेशन की लागत आती है। बड़ा ब्लॉक पूर्ण स्नैपशॉटिंग सक्षम होने पर स्टेट स्नैपशॉट के लिए प्रति-टोकन मेमोरी लागत भी बढ़ाता है।
स्रोत: Habr — хаб ИИ — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार