Qwen2.5: ¡Una Fiesta de Modelos Fundacionales!
Alibaba/Qwen
Meta
Mistral
OpenAI
Anthropic
DeepSeek
Microsoft
Google/DeepMind
El equipo Qwen de Alibaba anuncia el lanzamiento de código abierto de los LLMs Qwen2.5, junto con modelos especializados para programación (Qwen2.5-Coder) y matemáticas (Qwen2.5-Math). Los modelos van desde 0,5B hasta 72B parámetros, preentrenados con hasta 18 billones de tokens, con mejoras significativas en conocimiento, programación y capacidades matemáticas. El lanzamiento también incluye los modelos API Qwen-Plus y Qwen-Turbo.
El equipo de Qwen de Alibaba ha lanzado Qwen2.5, una familia de modelos de lenguaje de solo decodificador de código abierto, junto con los modelos especializados Qwen2.5-Coder y Qwen2.5-Math. Los modelos están disponibles en tamaños que van desde 0,5 mil millones hasta 72 mil millones de parámetros, preentrenados con hasta 18 billones de tokens. Qwen2.5 alcanza MMLU 85+, HumanEval 85+ y MATH 80+, admite un contexto de hasta 128.000 tokens y una generación de 8.000 tokens, y ofrece soporte multilingüe para más de 29 idiomas. Qwen2.5-Coder se entrenó con 5,5 billones de tokens de datos de código, mientras que Qwen2.5-Math admite razonamiento CoT (cadena de pensamiento), PoT (programa de pensamiento) y TIR (razonamiento de intérprete de herramientas). También se ofrecen los modelos API insignia Qwen-Plus y Qwen-Turbo. Las variantes de 3 mil millones y 72 mil millones de parámetros no tienen licencia Apache 2.0.
Fuente: Alibaba Qwen —
original
