Microsoft apresenta modelos de IA MAI-Image-2.5-Pro e MAI-Voice-2-Flash para geração de imagens e reconhecimento de fala
Microsoft
OpenAI
Anthropic
A Microsoft lançou dois novos modelos de IA proprietários: o MAI-Image-2.5-Pro para geração de imagens de alta qualidade e o MAI-Voice-2-Flash para reconhecimento de fala de baixa latência em cargas de trabalho empresariais. A empresa destaca economias de custo significativas e melhorias de desempenho ao substituir modelos da OpenAI pelos seus próprios em produtos como Bing, PowerPoint e Dynamics 365.
A Microsoft lançou visualizações públicas de dois novos modelos de IA desenvolvidos internamente. O MAI-Image-2.5-Pro é o gerador de imagens principal, oferecendo geração de alta qualidade, edição detalhada e renderização precisa de texto. O MAI-Voice-2-Flash é otimizado para aplicações de voz de alto rendimento, como centrais de atendimento, sendo duas vezes mais rápido e custando 32% menos que o modelo base. A empresa informa que o Bing Image Creator agora funciona totalmente no MAI-Image-2.5, e o PowerPoint reduziu os custos de recursos de GPU em 84% em comparação com o uso do GPT-Image-2 da OpenAI. O MAI-Voice-2-Flash, implantado no Dynamics 365 Contact Center, reduziu os custos de GPU em até 89% e também está integrado ao Azure Voice Live. O Dragon Copilot da Microsoft, usado por 170 mil organizações de saúde, foi migrado para o MAI-Transcribe-1.5, que suporta 58 idiomas. O modelo leve MAI-Code-1-Flash no GitHub Copilot mostra uma aceitação de código 10% melhor que o GPT-5.4 Mini e o Claude Haiku 4.5, com menor consumo de tokens, e foi treinado adicionalmente para tarefas do Excel, nas quais tem desempenho no nível do GPT-5.6, rodando em aceleradores Nvidia H100 e A100 mais antigos.
Fonte: 3DNews —
original
