Código AbertoModelos 🇨🇳 28.07.2026 16:03

Alibaba disponibiliza em código aberto o Qwen2.5-1M com suporte a contexto de até 1 milhão de tokens

Alibaba/QwenAlibaba/Qwen
A Alibaba lançou os modelos abertos Qwen2.5-7B-Instruct-1M e Qwen2.5-14B-Instruct-1M com contexto de até 1 milhão de tokens, além de um framework de inferência otimizado baseado no vLLM. Os modelos superam versões anteriores e o GPT-4o-mini em tarefas de contexto longo, mantendo o desempenho em textos curtos.
A Alibaba Qwen apresentou os modelos abertos Qwen2.5-7B-Instruct-1M e Qwen2.5-14B-Instruct-1M, capazes de processar contexto de até 1 milhão de tokens. Para sua implantação, a empresa abriu completamente o framework de inferência baseado em vLLM, que utiliza atenção esparsa (sparse attention) e acelera o processamento de 1M de tokens em 3 a 7 vezes. Os modelos foram treinados progressivamente: primeiro em sequências de até 256 mil tokens e, em seguida, por meio de extrapolação de comprimento (Dual Chunk Attention), expandidos para 1M. Em testes de recuperação de senha (Passkey Retrieval) e tarefas complexas (RULER, LV-Eval, LongBench), os modelos superaram significativamente as versões com 128 mil tokens e o GPT-4o-mini. Para inferência, recomenda-se GPU com arquitetura Ampere ou Hopper, com pelo menos 120 GB de VRAM para o modelo de 7B e 320 GB para o de 14B. Também foi apresentado o Qwen Chat, um assistente de IA com suporte a contexto longo.
Fonte: Alibaba Qwen — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas