Qwen2.5-LLM: Die Grenzen von Sprachmodellen erweitern
Alibaba/Qwen
Das Qwen-Team von Alibaba hat die Qwen2.5-Serie von Sprachmodellen veröffentlicht, darunter sieben Open-Source-Modelle mit 0,5B bis 72B Parametern. Die Modelle zeichnen sich durch einen größeren Vortrainingsdatensatz (bis zu 18 Billionen Tokens), verbesserte Kenntnisse, Codierungs- und Mathematikfähigkeiten aus und unterstützen Kontextlängen von bis zu 128K Tokens.
Das Qwen-Team von Alibaba hat die Sprachmodelle der Qwen2.5-Serie angekündigt, die dekoder-basierte dichte Modelle sind. Sieben Modelle wurden als Open Source veröffentlicht: mit 0,5 Milliarden, 1,5 Milliarden, 3 Milliarden, 7 Milliarden, 14 Milliarden, 32 Milliarden und 72 Milliarden Parametern. Der Datensatz für das Vortraining wurde von 7 Billionen auf 18 Billionen Tokens erweitert. Im Vergleich zu Qwen2 zeigt Qwen2.5 Verbesserungen bei MMLU, Codierungs-Benchmarks (LiveCodeBench, MultiPL-E, MBPP) und Mathematik-Benchmarks (MATH). Qwen2.5-72B übertrifft Llama-3-405B bei mehreren Aufgaben, während es nur ein Fünftel der Parameter benötigt. Zusätzliche Modelle, Qwen-Plus und Qwen-Turbo, sind über die Alibaba Cloud Model Studio API verfügbar. Die meisten Modelle sind unter der Apache-2.0-Lizenz lizenziert, mit Ausnahme von Qwen2.5-3B und Qwen2.5-72B, die separate Lizenzen haben.
Quelle: Alibaba Qwen —
Original
