Alibaba verlengt contextlengte Qwen2.5-Turbo naar 1 miljoen tokens
Alibaba/Qwen
OpenAI
Alibaba brengt Qwen2.5-Turbo uit met een contextlengte die is verlengd van 128.000 naar 1 miljoen tokens. Het model behaalt 100% nauwkeurigheid op de 1M Passkey Retrieval-taak en scoort 93,1 op de RULER-benchmark, waarmee het GPT-4 overtreft. De inferentiesnelheid is tot 4,3 keer verbeterd door gebruik van sparse attention, terwijl de kosten op ¥0,3 per 1 miljoen tokens blijven.
Alibaba heeft de lancering aangekondigd van het Qwen2.5-Turbo-model, waarvan de contextlengte is uitgebreid van 128K naar 1M tokens, wat overeenkomt met ongeveer 1 miljoen Engelse woorden of 1,5 miljoen Chinese karakters. Het model behaalt 100% nauwkeurigheid in de 1M-lengte Passkey Retrieval-taak en scoort 93,1 op de long-text evaluatiebenchmark RULER, waarmee het GPT-4's 91,6 en GLM4-9B-1M's 89,9 overtreft. Door gebruik te maken van sparse attention-mechanismen wordt de tijd tot het eerste token voor een context van 1M tokens teruggebracht van 4,9 minuten naar 68 seconden, een versnelling van 4,3x. De prijs blijft ¥0,3 per 1M tokens, waardoor Qwen2.5-Turbo 3,6 keer meer tokens kan verwerken dan GPT-4o-mini voor dezelfde kosten. Het model behoudt concurrerende korte-reekscapaciteiten, op gelijk niveau met GPT-4o-mini. Het is beschikbaar via de Alibaba Cloud Model Studio API, de HuggingFace Demo en de ModelScope Demo.
Bron: Alibaba Qwen —
origineel
