ModelosPesquisa 🇨🇳 28.07.2026 00:03

Qwen2.5 Omni: Vê, Ouve, Fala, Escreve — Tudo em Um

Alibaba/QwenAlibaba/Qwen
A Alibaba Qwen lançou o Qwen2.5-Omni, um novo modelo multimodal de ponta capaz de processar texto, imagens, áudio e vídeo, bem como gerar respostas em texto e fala natural em tempo real. O modelo, construído em uma arquitetura Thinker-Talker, é de código aberto e demonstra alto desempenho em todas as modalidades.
A Alibaba Qwen lançou o Qwen2.5-Omni, um modelo multimodal de ponta a ponta que processa texto, imagens, áudio e vídeo e gera simultaneamente texto e fala natural em tempo real. O modelo é baseado em uma nova arquitetura Thinker-Talker, onde o Thinker (análogo ao cérebro) processa entradas de diferentes modalidades e cria representações de alto nível, enquanto o Talker (análogo à boca) gera tokens de fala com base nessas representações. Também foi proposto um novo posicionamento chamado TMRoPE (Time-aligned Multimodal RoPE), que sincroniza os carimbos de tempo de vídeo e áudio. O Qwen2.5-Omni suporta processamento totalmente em tempo real, incluindo entrada em blocos e saída imediata. Em termos de qualidade de geração de fala, o modelo supera muitas alternativas de streaming e não streaming existentes. Nos benchmarks, o Qwen2.5-Omni apresenta resultados comparáveis ao Qwen2.5-VL-7B em visão, supera o Qwen2-Audio em áudio e, em tarefas de integração de modalidades (OmniBench), alcança o estado da arte. O modelo está disponível no Hugging Face, ModelScope, DashScope e GitHub, bem como através do Qwen Chat e de uma demonstração.
Fonte: Alibaba Qwen — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas