ModelosCódigo Aberto 🇨🇳 28.07.2026 17:04

Alibaba Estende o Comprimento do Contexto do Qwen2.5-Turbo para 1 Milhão de Tokens

Alibaba/QwenAlibaba/Qwen OpenAIOpenAI
A Alibaba lança o Qwen2.5-Turbo com um comprimento de contexto estendido de 128K para 1M de tokens. O modelo atinge 100% de precisão na tarefa de Recuperação de Chave de 1M e pontua 93,1 no benchmark RULER, superando o GPT-4. A velocidade de inferência é melhorada em até 4,3 vezes usando atenção esparsa, enquanto os custos permanecem em ¥0,3 por 1M de tokens.
A Alibaba anunciou o modelo Qwen2.5-Turbo, que amplia seu comprimento de contexto de 128 mil para 1 milhão de tokens, o equivalente a cerca de 1 milhão de palavras em inglês ou 1,5 milhão de caracteres chineses. O modelo atinge 100% de precisão na tarefa de recuperação de senha (Passkey Retrieval) com comprimento de 1 milhão e obtém 93,1 no benchmark de avaliação de textos longos RULER, superando os 91,6 do GPT-4 e os 89,9 do GLM4-9B-1M. Utilizando mecanismos de atenção esparsa, o tempo até o primeiro token para um contexto de 1 milhão de tokens foi reduzido de 4,9 minutos para 68 segundos, um ganho de velocidade de 4,3 vezes. O preço permanece em ¥0,3 por 1 milhão de tokens, permitindo que o Qwen2.5-Turbo processe 3,6 vezes mais tokens que o GPT-4o-mini pelo mesmo custo. O modelo mantém capacidades competitivas em sequências curtas, equiparáveis ao GPT-4o-mini. Ele está disponível por meio da API Alibaba Cloud Model Studio, da demonstração no HuggingFace e da demonstração no ModelScope.
Fonte: Alibaba Qwen — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas