Alibaba Extiende la Longitud de Contexto de Qwen2.5-Turbo a 1 Millón de Tokens
Alibaba/Qwen
OpenAI
Alibaba lanza Qwen2.5-Turbo con una longitud de contexto extendida de 128K a 1M de tokens. El modelo alcanza un 100% de precisión en la tarea de recuperación de Passkey de 1M y obtiene 93.1 en el benchmark RULER, superando a GPT-4. La velocidad de inferencia mejora hasta 4.3x usando atención dispersa, mientras que los costos se mantienen en ¥0.3 por 1M de tokens.
Alibaba ha presentado el modelo Qwen2.5-Turbo, que amplía su longitud de contexto de 128K a 1 millón de tokens, equivalente aproximadamente a 1 millón de palabras en inglés o 1,5 millones de caracteres chinos. El modelo alcanza una precisión del 100% en la tarea de Recuperación de Passkey con una longitud de 1 millón y obtiene una puntuación de 93.1 en el benchmark de evaluación de textos largos RULER, superando el 91.6 de GPT-4 y el 89.9 de GLM4-9B-1M. Utilizando mecanismos de atención dispersa, el tiempo hasta el primer token para un contexto de 1 millón de tokens se reduce de 4,9 minutos a 68 segundos, una aceleración de 4,3 veces. El precio se mantiene en 0,3 yuanes por cada millón de tokens, lo que permite a Qwen2.5-Turbo procesar 3,6 veces más tokens que GPT-4o-mini al mismo costo. El modelo conserva capacidades competitivas en secuencias cortas, a la par de GPT-4o-mini. Está disponible a través de la API de Alibaba Cloud Model Studio, la demostración de HuggingFace y la demostración de ModelScope.
Fuente: Alibaba Qwen —
original
