Tencent Yuanbao ra mắt mô hình nhận dạng giọng nói Hy ASR 3.0 Preview: Hiểu được nhiều phương ngữ và môi trường phức tạp
Tencent
Tencent Yuanbao vừa phát hành mô hình nhận dạng giọng nói Hy ASR (Automatic Speech Recognition - nhận dạng giọng nói tự động) 3.0 bản Preview, có khả năng nhận diện nhiều phương ngữ khác nhau và hoạt động ổn định trong các môi trường âm học phức tạp. Mô hình được xây dựng dựa trên một mô hình nền tảng âm thanh quy mô lớn với kiến trúc streaming đa tầng, đạt độ chính xác cao và độ trễ thấp.
Tencent Yuanbao, trợ lý AI của Tencent, vừa giới thiệu mô hình nhận dạng giọng nói Hy ASR 3.0 bản xem trước (ASR - Automatic Speech Recognition, tức nhận dạng giọng nói tự động). Mô hình này được thiết kế để chuyển lồi nói thành văn bản một cách chính xác trên nhiều phương ngữ tiếng Trung khác nhau, cũng như trong các điều kiện âm học khó khăn như môi trường nhiều tiếng ồn. Mô hình tận dụng một mô hình nền tảng âm thanh quy mô lớn kết hợp với kiến trúc truyền phát (streaming) đa lớp, nhờ đó đạt độ chính xác nhận dạng cao và độ trễ thấp. Việc phát hành bản xem trước này cho thấy Tencent đang tiếp tục nỗ lực nâng cao năng lực AI của mình trong lĩnh vực xử lý giọng nói.
Nguồn: Tencent Hunyuan (GNews) —
bản gốc
