Qwen2.5-LLM: Expandindo os Limites dos Modelos de Linguagem
Alibaba/Qwen
A equipe Qwen da Alibaba lançou a série Qwen2.5 de modelos de linguagem, incluindo sete modelos de código aberto que variam de 0,5B a 72B parâmetros. Os modelos apresentam um conjunto de dados de pré-treinamento maior (até 18 trilhões de tokens), capacidades aprimoradas de conhecimento, codificação e matemática, e suportam comprimentos de contexto de até 128 mil tokens.
A equipe Qwen da Alibaba anunciou os modelos de linguagem da série Qwen2.5, que são modelos densos apenas com decodificador. Sete modelos foram disponibilizados como código aberto: 0,5B, 1,5B, 3B, 7B, 14B, 32B e 72B parâmetros. O conjunto de dados de pré-treinamento foi expandido de 7 trilhões para 18 trilhões de tokens. Em comparação com o Qwen2, o Qwen2.5 apresenta melhorias em MMLU, benchmarks de codificação (LiveCodeBench, MultiPL-E, MBPP) e benchmarks de matemática (MATH). O Qwen2.5-72B supera o Llama-3-405B em várias tarefas, utilizando um quinto dos parâmetros. Modelos adicionais Qwen-Plus e Qwen-Turbo estão disponíveis via API do Alibaba Cloud Model Studio. A maioria dos modelos é licenciada sob Apache 2.0, exceto Qwen2.5-3B e Qwen2.5-72B, que possuem licenças separadas.
Fonte: Alibaba Qwen —
original
