Microsoft ra mắt mô hình AI MAI-Image-2.5-Pro và MAI-Voice-2-Flash cho tạo ảnh và nhận dạng giọng nói
Microsoft
OpenAI
Anthropic
Microsoft đã phát hành hai mô hình AI độc quyền mới: MAI-Image-2.5-Pro dành cho tạo ảnh chất lượng cao và MAI-Voice-2-Flash dành cho nhận dạng giọng nói độ trễ thấp trong các tác vụ doanh nghiệp. Công ty nhấn mạnh khả năng tiết kiệm chi phí đáng kể và cải thiện hiệu suất khi thay thế các mô hình của OpenAI bằng mô hình của mình trên các sản phẩm như Bing, PowerPoint và Dynamics 365.
Microsoft đã phát hành bản xem trước công khai của hai mô hình AI mới do nội bộ phát triển. MAI-Image-2.5-Pro là mô hình tạo hình ảnh hàng đầu, cung cấp khả năng tạo ảnh chất lượng cao, chỉnh sửa chi tiết và hiển thị văn bản chính xác. MAI-Voice-2-Flash được tối ưu hóa cho các ứng dụng giọng nói thông lượng cao như trung tâm cuộc gọi, chạy nhanh gấp đôi và chi phí thấp hơn 32% so với mô hình cơ sở. Công ty cho biết Bing Image Creator hiện hoàn toàn chạy trên MAI-Image-2.5, và PowerPoint đã giảm 84% chi phí tài nguyên GPU so với khi sử dụng GPT-Image-2 của OpenAI. MAI-Voice-2-Flash được triển khai trong Dynamics 365 Contact Center đã cắt giảm chi phí GPU lên tới 89% và cũng được tích hợp vào Azure Voice Live. Dragon Copilot của Microsoft, được 170.000 tổ chức chăm sóc sức khỏe sử dụng, đã được chuyển sang MAI-Transcribe-1.5 hỗ trợ 58 ngôn ngữ. Mô hình nhẹ MAI-Code-1-Flash trên GitHub Copilot cho thấy tỷ lệ chấp nhận mã cao hơn 10% so với GPT-5.4 Mini và Claude Haiku 4.5, với mức tiêu thụ token thấp hơn, và được huấn luyện thêm cho các tác vụ Excel, nơi nó hoạt động ở cấp độ GPT-5.6 trong khi chạy trên các bộ tăng tốc Nvidia H100 và A100 cũ hơn.
Nguồn: 3DNews —
bản gốc
