Hugging Face Transformers Arka Ucu vLLM'de Yerel Performansa Ulaştı
Hugging Face
Hugging Face Transformers'ın vLLM'de modelleme arka ucu olarak entegrasyonu, yoğun ve uzman karışımı mimariler dahil olmak üzere çeşitli Qwen3 modellerinde artık yerel vLLM çıktı hızına eşit veya onu aşmaktadır. Bu, özel taşıma gerektirmeden, torch.fx ve soyut sözdizimi ağacı manipülasyonu kullanılarak çalışma zamanında dinamik katman birleştirmeleri yoluyla elde edilir ve uyumlu herhangi bir modelin tek bir bayrakla yerel hızda çalışmasına olanak tanır.
450'den fazla mimariyi destekleyen Hugging Face Transformers kütüphanesi, geçen yıldan bu yana vLLM'de bir modelleme arka ucu olarak entegre edilmiş durumda. Bu sayede model yazarları, modellerini taşımak zorunda kalmadan vLLM içinde çalıştırabiliyor. Bu entegrasyonun en son sürümü artık uyumlu modeller için yerel vLLM çıkarım hızına ulaşıyor. Üç Qwen3 modeli (4B yoğun, 32B yoğun ve 235B FP8 Uzman Karışımı) üzerinde Transformers arka ucunu vLLM'nin yerel uygulamalarıyla karşılaştıran kıyaslamalar, Transformers arka ucunun tüm durumlarda yerel işlem hızını yakaladığını veya geçtiğini gösteriyor. Performans iyileştirmesi, çalışma zamanında çıkarıma özgü katman birleştirmelerinin dinamik olarak uygulanmasından geliyor; bu işlem için statik analizde torch.fx ve kaynak kod dönüşümünde Soyut Sözdizimi Ağacı (AST) kullanılıyor. Bu birleştirmeler, Uzman Karışımı modellerinde uzman paralelleştirmesi için vLLM'nin optimize edilmiş çekirdeklerine eşlenen işlemleri ve tensör ile pipeline paralelliği için paralel doğrusal katmanları içeriyor. Değiştirilen modeller torch.compile ve CUDA Grafikleri ile tamamen derlenebilir durumda kalıyor. Herhangi bir Hugging Face modeli, --model-impl transformers tek bayrağıyla çalıştırılabiliyor ve mevcut paralellik seçenekleriyle uyumlu çalışıyor. Doğrusal dikkat mekanizmasına sahip modeller henüz desteklenmiyor ve Hub deposundaki özel modellerin çalışması pek olası değil.
Kaynak: Hugging Face blog —
orijinal
