Qwen2.5 Omni: Ve, Oye, Habla, Escribe — Todo en Uno
Alibaba/Qwen
Alibaba Qwen ha lanzado Qwen2.5-Omni, un nuevo modelo multimodal insignia capaz de procesar texto, imágenes, audio y vídeo, así como de generar respuestas en texto y habla natural en tiempo real. El modelo, construido sobre una arquitectura Thinker-Talker, es de código abierto y demuestra un alto rendimiento en todas las modalidades.
Alibaba Qwen ha lanzado Qwen2.5-Omni, un modelo multimodal extremo a extremo que percibe texto, imágenes, audio y video, y simultáneamente genera texto y habla natural en tiempo real. El modelo se basa en una nueva arquitectura Thinker-Talker, donde Thinker (análogo al cerebro) procesa las entradas de diferentes modalidades y crea representaciones de alto nivel, mientras que Talker (análogo a la boca) produce los tokens de habla a partir de estas representaciones. También se ha propuesto un nuevo posicionamiento posicional TMRoPE (Time-aligned Multimodal RoPE), que sincroniza las marcas de tiempo de video y audio. Qwen2.5-Omni admite tiempo real completo, incluyendo entrada por fragmentos y salida inmediata. En cuanto a la calidad de generación de habla, el modelo supera a muchas alternativas existentes, tanto en streaming como sin él. En los puntos de referencia, Qwen2.5-Omni muestra resultados comparables a Qwen2.5-VL-7B en visión, supera a Qwen2-Audio en audio y alcanza un nivel de vanguardia en tareas de integración de modalidades (OmniBench). El modelo está disponible en Hugging Face, ModelScope, DashScope y GitHub, así como a través de Qwen Chat y una demostración.
Fuente: Alibaba Qwen —
original
