Microsoft stellt KI-Modelle MAI-Image-2.5-Pro und MAI-Voice-2-Flash für Bildgenerierung und Spracherkennung vor
Microsoft
OpenAI
Anthropic
Microsoft hat zwei neue proprietäre KI-Modelle veröffentlicht: MAI-Image-2.5-Pro für hochwertige Bildgenerierung und MAI-Voice-2-Flash für latenzarme Spracherkennung in Unternehmensanwendungen. Das Unternehmen hebt deutliche Kosteneinsparungen und Leistungsverbesserungen hervor, wenn OpenAI-Modelle durch eigene Modelle in Produkten wie Bing, PowerPoint und Dynamics 365 ersetzt werden.
Microsoft hat öffentliche Vorschauversionen von zwei neuen, intern entwickelten KI-Modellen veröffentlicht. MAI-Image-2.5-Pro ist das Flaggschiff unter den Bildgeneratoren und bietet hochwertige Generierung, detaillierte Bearbeitung sowie präzise Textwiedergabe. MAI-Voice-2-Flash ist für sprachintensive Anwendungen wie Callcenter optimiert, läuft doppelt so schnell und kostet 32 Prozent weniger als das Basismodell. Das Unternehmen berichtet, dass Bing Image Creator nun vollständig auf MAI-Image-2.5 basiert und PowerPoint die GPU-Ressourcenkosten im Vergleich zur Nutzung von OpenAIs GPT-Image-2 um 84 Prozent gesenkt hat. MAI-Voice-2-Flash, das im Dynamics 365 Contact Center eingesetzt wird, reduzierte die GPU-Kosten um bis zu 89 Prozent und ist auch in Azure Voice Live integriert. Microsofts Dragon Copilot, das von 170.000 Gesundheitsorganisationen genutzt wird, wurde auf MAI-Transcribe-1.5 migriert, das 58 Sprachen unterstützt. Das leichte MAI-Code-1-Flash-Modell auf GitHub Copilot zeigt eine um 10 Prozent bessere Code-Akzeptanz als GPT-5.4 Mini und Claude Haiku 4.5 bei geringerem Tokenverbrauch und wurde zusätzlich für Excel-Aufgaben trainiert, bei denen es auf dem Niveau von GPT-5.6 arbeitet, während es auf älteren Nvidia H100- und A100-Beschleunigern läuft.
Quelle: 3DNews —
Original
