Mistral AI phát hành Voxtral Transcribe 2 — mô hình nhận dạng giọng nói độ trễ siêu thấp
Mistral
Mistral AI
Mistral AI đã ra mắt Voxtral Transcribe 2, một dòng mô hình chuyển giọng nói thành văn bản bao gồm Voxtral Mini Transcribe V2 cho phiên dịch hàng loạt và Voxtral Realtime cho các ứng dụng trực tiếp với độ trễ dưới 200ms. Voxtral Realtime có trọng số mở theo giấy phép Apache 2.0. Cả hai mô hình đều hỗ trợ 13 ngôn ngữ và cung cấp chất lượng phiên dịch tiên tiến với tính năng phân biệt người nói.
Mistral AI vừa phát hành Voxtral Transcribe 2, một dòng mô hình chuyển giọng nói thành văn bản thế hệ mới. Dòng sản phẩm này bao gồm Voxtral Mini Transcribe V2 dành cho phiên âm hàng loạt và Voxtral Realtime dành cho phiên âm trực tiếp với độ trễ có thể cấu hình xuống dưới 200 mili giây (ms). Voxtral Realtime là mã nguồn mở theo giấy phép Apache 2.0. Cả hai mô hình đều hỗ trợ 13 ngôn ngữ: tiếng Anh, tiếng Trung, tiếng Hindi, tiếng Tây Ban Nha, tiếng Ả Rập, tiếng Pháp, tiếng Bồ Đào Nha, tiếng Nga, tiếng Đức, tiếng Nhật, tiếng Hàn, tiếng Ý và tiếng Hà Lan. Voxtral Mini Transcribe V2 đạt tỷ lệ lỗi từ (WER) khoảng 4% trên bộ đánh giá FLEURS với chi phí 0,003 đô la Mỹ (USD) mỗi phút, vượt trội so với các đối thủ như GPT-4o mini Transcribe và Gemini 2.5 Flash. Mô hình còn có các tính năng như phân đoạn người nói (speaker diarization), tinh chỉnh ngữ cảnh (context biasing), dấu thời gian ở mức từ, độ chắc chắn trước nhiễu và hỗ trợ âm thanh dài tới 3 giờ. Voxtral Realtime, với kích thước tham số 4 tỷ (4B), chạy hiệu quả trên các thiết bị biên và cung cấp độ chính xác gần như ngoại tuyến ngay cả với độ trễ 480 ms. Mistral cũng ra mắt một audio playground (sân chơi âm thanh) trong Mistral Studio để kiểm thử phiên âm kèm phân đoạn người nói và dấu thời gian.
Nguồn: Mistral AI —
bản gốc
