Alibaba, 1 milyon tokena kadar bağlam desteğiyle Qwen2.5-1M'nin kaynak kodunu açtı
Alibaba/Qwen
Alibaba, 1 milyon tokena kadar bağlam ile Qwen2.5-7B-Instruct-1M ve Qwen2.5-14B-Instruct-1M modellerini ve vLLM tabanlı optimize edilmiş bir çıkarım çerçevesini açık kaynak olarak yayınladı. Modeller, uzun bağlam görevlerinde önceki sürümleri ve GPT-4o-mini'yi geride bırakırken kısa metinlerde performansı koruyor.
Alibaba Qwen, Qwen2.5-7B-Instruct-1M ve Qwen2.5-14B-Instruct-1M açık modellerini tanıttı; bu modeller 1 milyon tokene kadar bağlam işleyebiliyor. Dağıtımları için şirket, vLLM tabanlı çıkarım çerçevesini tamamen açık kaynak olarak yayınladı; bu çerçeve seyrek dikkat (sparse attention) kullanarak 1 milyon token işlemeyi 3 ila 7 kat hızlandırıyor. Modeller aşamalı olarak eğitildi: önce 256 bin tokena kadar dizilerde, ardından uzunluk ekstrapolasyonu (Dual Chunk Attention) ile 1 milyona genişletildi. Parola Bulma (Passkey Retrieval) ve karmaşık görevlerde (RULER, LV-Eval, LongBench) yapılan testlerde modeller, 128 bin tokenlık sürümleri ve GPT-4o-mini'yi önemli ölçüde geride bıraktı. Çıkarım için Ampere veya Hopper mimarisine sahip GPU'lar, 7B model için en az 120 GB VRAM ve 14B model için 320 GB VRAM öneriliyor. Ayrıca, uzun bağlam desteğine sahip bir yapay zeka asistanı olan Qwen Chat de tanıtıldı.
Kaynak: Alibaba Qwen —
orijinal
