Alibaba publica el código fuente de Qwen2.5-1M con soporte de contexto de hasta 1 millón de tokens
Alibaba/Qwen
Alibaba ha lanzado los modelos de código abierto Qwen2.5-7B-Instruct-1M y Qwen2.5-14B-Instruct-1M con un contexto de hasta 1 millón de tokens, junto con un marco de inferencia optimizado basado en vLLM. Los modelos superan a versiones anteriores y a GPT-4o-mini en tareas de contexto largo, manteniendo el rendimiento en textos cortos.
Alibaba Qwen ha presentado los modelos de código abierto Qwen2.5-7B-Instruct-1M y Qwen2.5-14B-Instruct-1M, capaces de procesar un contexto de hasta 1 millón de tokens. Para su despliegue, la compañía ha abierto completamente el framework de inferencia basado en vLLM, que utiliza atención dispersa (sparse attention) y acelera el procesamiento de 1M de tokens entre 3 y 7 veces. Los modelos se entrenaron de forma progresiva: primero con secuencias de hasta 256K tokens, y luego, mediante extrapolación de longitud (Dual Chunk Attention), se ampliaron hasta 1M. En pruebas de recuperación de contraseña (Passkey Retrieval) y tareas complejas (RULER, LV-Eval, LongBench), los modelos superaron significativamente a las versiones con 128K y a GPT-4o-mini. Para la inferencia, se recomienda una GPU con arquitectura Ampere o Hopper, con al menos 120 GB de VRAM para 7B y 320 GB para 14B. También se ha presentado Qwen Chat, un asistente de inteligencia artificial con soporte para contexto largo.
Fuente: Alibaba Qwen —
original
