⚡ ÚLTIMA HORA
ModelosGeração de Mídia 🇨🇳 28.07.2026 00:03

Qwen2.5 Omni: Vê, Ouve, Fala, Escreve – Tudo em Um

Alibaba/QwenAlibaba/Qwen
A Alibaba Qwen lançou o Qwen2.5-Omni, um modelo multimodal emblemático capaz de processar texto, imagens, áudio e vídeo, além de gerar fala em tempo real. O modelo utiliza a arquitetura Thinker-Talker e supera modelos similares em todas as modalidades.
A Alibaba Qwen revelou o Qwen2.5-Omni, um novo modelo emblemático da série Qwen projetado para percepção multimodal abrangente. O modelo processa texto, imagens, áudio e vídeo, gerando respostas em streaming na forma de texto ou fala natural. A arquitetura Thinker-Talker inclui um Thinker que entende a entrada e um Talker que gera fala. O modelo está disponível no Hugging Face, ModelScope, DashScope e GitHub. O Qwen2.5-Omni supera o Qwen2.5-VL-7B e o Qwen2-Audio em tarefas de áudio, é comparável em vídeo e imagens e alcança resultados de última geração no OmniBench. O modelo também demonstra alta precisão em reconhecimento de fala, tradução, compreensão de áudio e geração de fala. Os planos futuros incluem melhorar a adesão a comandos de voz e integrar mais modalidades.
Fonte: Alibaba Qwen — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas