模型媒体生成 🇷🇺 26.07.2026 16:03

微软发布 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash AI 模型,用于图像生成与语音识别

MicrosoftMicrosoft OpenAIOpenAI AnthropicAnthropic
微软发布了两款新的专有 AI 模型:MAI-Image-2.5-Pro 用于高质量图像生成,MAI-Voice-2-Flash 用于企业工作负载中的低延迟语音识别。公司强调,在 Bing、PowerPoint 和 Dynamics 365 等产品中用自家模型替换 OpenAI 模型,可显著节省成本并提升性能。
微软发布了两个内部开发的AI模型的公开预览版。MAI-Image-2.5-Pro是旗舰图像生成器,提供高质量生成、精细编辑和准确的文本渲染。MAI-Voice-2-Flash针对呼叫中心等高吞吐量语音应用进行了优化,运行速度是基础模型的两倍,成本降低32%。该公司表示,Bing图像创建器现已完全运行在MAI-Image-2.5上,与使用OpenAI的GPT-Image-2相比,PowerPoint的GPU资源成本降低了84%。部署在Dynamics 365联络中心的MAI-Voice-2-Flash将GPU成本降低了高达89%,并已集成到Azure语音实时服务中。微软的Dragon Copilot(被17万家医疗机构使用)已迁移至支持58种语言的MAI-Transcribe-1.5。GitHub Copilot上的轻量级MAI-Code-1-Flash模型显示出比GPT-5.4 Mini和Claude Haiku 4.5高出10%的代码接受率,且token消耗更低;该模型还针对Excel任务进行了进一步训练,其性能达到GPT-5.6水平,同时运行在较旧的Nvidia H100和A100加速器上。
来源: 3DNews — 原文
我们之前关于此话题的帖子 ↓
最新新闻