⚡ ÚLTIMA HORA
ModelosGeneración de Medios 🇨🇳 28.07.2026 00:03

Qwen2.5 Omni: Ve, Oye, Habla, Escribe – Todo en Uno

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen ha lanzado Qwen2.5-Omni, un modelo multimodal insignia capaz de procesar texto, imágenes, audio y video, así como generar voz en tiempo real. El modelo utiliza la arquitectura Thinker-Talker y supera a modelos similares en todas las modalidades.
Alibaba Qwen ha presentado Qwen2.5-Omni, un nuevo modelo insignia de la serie Qwen diseñado para la percepción multimodal integral. El modelo procesa texto, imágenes, audio y vídeo, generando respuestas en streaming en forma de texto o habla natural. La arquitectura Thinker-Talker incluye un Thinker que comprende la entrada y un Talker que genera habla. El modelo está disponible en Hugging Face, ModelScope, DashScope y GitHub. Qwen2.5-Omni supera a Qwen2.5-VL-7B y Qwen2-Audio en tareas de audio, es comparable en vídeo e imágenes, y logra resultados de última generación en OmniBench. El modelo también demuestra alta precisión en reconocimiento de voz, traducción, comprensión de audio y generación de habla. Los planes futuros incluyen mejorar la adherencia a comandos de voz e integrar más modalidades.
Fuente: Alibaba Qwen — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas