Mô hìnhKinh doanh & Thị trường 🇺🇸 31.07.2026 09:02

PolyAI giới thiệu Dialog-RSN-1: mô hình hội thoại gốc âm thanh tích hợp quản lý lượt thoại, nhận dạng giọng nói, gọi hàm và tạo phản hồi

PolyAIPolyAI OpenAIOpenAI Google/DeepMindGoogle/DeepMind Alibaba/QwenAlibaba/Qwen MistralMistral
PolyAI đã phát hành Dialog-RSN-1, một mô hình hội thoại gốc âm thanh xử lý trực tiếp âm thanh, tích hợp quản lý lượt thoại, nhận dạng giọng nói, gọi hàm và tạo phản hồi. Mô hình này đã được sử dụng trong sản xuất, mang lại phản hồi dưới 300 mili giây và cải thiện 11% về khả năng giữ chân và 37% về độ trễ. Chỉ khả dụng qua nền tảng PolyAI, không có trọng số mở hay API công khai.
PolyAI đã giới thiệu Dialog-RSN-1, một mô hình hội thoại có khả năng tiếp nhận trực tiếp âm thanh từ người gọi thay vì đọc bản chép lời. Mô hình này kết hợp quản lý lượt thoại, nhận dạng giọng nói, gọi hàm và tạo phản hồi trong một mô hình âm thanh gốc duy nhất và hiện đang xử lý các cuộc gọi sản xuất trực tiếp. Đầu vào của mô hình là âm thanh, nhưng bộ chuyển văn bản thành giọng nói vẫn là một thành phần riêng biệt, cho phép kiểm soát giọng nói. Mô hình hoạt động theo yêu cầu, không phải là một luồng liên tục, do đó không làm quá tải GPU liên tục. Token đầu ra đầu tiên là quyết định về lượt thoại: EMPTY, ONGOING hoặc COMPLETE. PolyAI báo cáo thời gian phản hồi dưới 300 mili giây, cải thiện tương đối 11% về khả năng giữ chân trong một nhóm nhà hàng và giảm 37% độ trễ ở một công ty bảo hiểm. Mô hình chỉ khả dụng thông qua nền tảng PolyAI, không có trọng số mở và API công khai, và chỉ hỗ trợ tiếng Anh. Kiến trúc bao gồm việc tiếp tục huấn luyện các mô hình đa phương thức có trọng số mở bằng cách sử dụng tinh chỉnh có giám sát và học tăng cường trên dữ liệu độc quyền. PolyAI đã đánh giá các mô hình Gemma, GPT-OSS, Qwen và Mistral. Tối ưu hóa độ trễ bao gồm việc điền sẵn bộ nhớ đệm chú ý, mẫu prompt có thêm nội dung, định tuyến mỗi người gọi đến cùng một GPU, bản nháp suy đoán với tỷ lệ chấp nhận trung bình 3,9 token và suy luận tự động được học trong quá trình tinh chỉnh học tăng cường. Việc phiên âm được thực hiện cuối cùng, song song với việc tạo giọng nói. PolyAI đã đánh giá mô hình trên bộ tiêu chuẩn nội bộ Dialog-Eval, dự kiến sẽ công bố. Đối với các ngôn ngữ không phải tiếng Anh, nên sử dụng Raven 3.5. Dự kiến sẽ có báo cáo kỹ thuật và bài viết về Dialog-Eval.
Nguồn: MarkTechPost — bản gốc
Bài viết liên quan trước đây ↓
Tin mới