ModelleOpen Source 🇨🇳 28.07.2026 17:04

Alibaba erweitert die Kontextlänge von Qwen2.5-Turbo auf 1 Million Tokens

Alibaba/QwenAlibaba/Qwen OpenAIOpenAI
Alibaba veröffentlicht Qwen2.5-Turbo mit einer auf 1 Million Tokens erweiterten Kontextlänge (bisher 128.000 Tokens). Das Modell erreicht eine 100-prozentige Genauigkeit bei der 1M-Passkey-Retrieval-Aufgabe und 93,1 Punkte im RULER-Benchmark und übertrifft damit GPT-4. Die Inferenzgeschwindigkeit wird durch Sparse Attention um bis zu 4,3-mal verbessert, während die Kosten bei 0,3 Yuan pro 1 Million Tokens bleiben.
Alibaba hat das Modell Qwen2.5-Turbo angekündigt, das seine Kontextlänge von 128.000 auf 1 Million Token erweitert, was etwa 1 Million englischen Wörtern oder 1,5 Millionen chinesischen Zeichen entspricht. Das Modell erreicht eine 100-prozentige Genauigkeit bei der 1-Million-Längen-Passkey-Abrufaufgabe und erzielt 93,1 Punkte im Benchmark für lange Texte RULER, wobei es GPT-4 mit 91,6 Punkten und GLM4-9B-1M mit 89,9 Punkten übertrifft. Durch den Einsatz von Aufmerksamkeitsmechanismen mit dünn besetzter Aufmerksamkeit wird die Zeit bis zum ersten Token für einen 1-Million-Token-Kontext von 4,9 Minuten auf 68 Sekunden reduziert, was einer 4,3-fachen Beschleunigung entspricht. Der Preis bleibt bei 0,3 Yuan pro 1 Million Token, sodass Qwen2.5-Turbo bei gleichen Kosten 3,6-mal mehr Token verarbeiten kann als GPT-4o-mini. Das Modell behält wettbewerbsfähige Kurztextfähigkeiten bei, die auf dem Niveau von GPT-4o-mini liegen. Es ist über die Alibaba Cloud Model Studio API, das HuggingFace Demo und das ModelScope Demo verfügbar.
Quelle: Alibaba Qwen — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten