Alibaba Perpanjang Panjang Konteks Qwen2.5-Turbo menjadi 1 Juta Token
Alibaba/Qwen
OpenAI
Alibaba merilis Qwen2.5-Turbo dengan panjang konteks yang diperpanjang dari 128K menjadi 1 juta token. Model ini mencapai akurasi 100% pada tugas Passkey Retrieval 1 juta token dan skor 93,1 pada tolok ukur RULER, melampaui GPT-4. Kecepatan inferensi ditingkatkan hingga 4,3 kali lipat menggunakan sparse attention, sementara biaya tetap ¥0,3 per 1 juta token.
Alibaba telah mengumumkan model Qwen2.5-Turbo, dengan memperpanjang panjang konteks dari 128K menjadi 1M token, setara dengan sekitar 1 juta kata dalam bahasa Inggris atau 1,5 juta karakter dalam bahasa Mandarin. Model ini mencapai akurasi 100% pada tugas Passkey Retrieval dengan panjang 1M dan memperoleh skor 93,1 pada tolok ukur evaluasi teks panjang RULER, mengungguli GPT-4 yang mendapat 91,6 dan GLM4-9B-1M dengan 89,9. Dengan menggunakan mekanisme sparse attention, waktu hingga token pertama untuk konteks sepanjang 1M token berkurang dari 4,9 menit menjadi 68 detik, atau peningkatan kecepatan 4,3 kali lipat. Harganya tetap ¥0,3 per 1M token, memungkinkan Qwen2.5-Turbo memproses 3,6 kali lebih banyak token dibandingkan GPT-4o-mini dengan biaya yang sama. Model ini tetap mempertahankan kemampuan sekuens pendek yang kompetitif, setara dengan GPT-4o-mini. Model ini tersedia melalui API Alibaba Cloud Model Studio, Demo HuggingFace, dan Demo ModelScope.
Sumber: Alibaba Qwen —
asli
