NVIDIA công bố mô hình thoại full-duplex mã nguồn mở NemotronLabs VoiceChat 11B với thời gian chuyển lượt 450 ms và gọi công cụ trực tiếp
NVIDIA
NVIDIA đã phát hành NemotronLabs VoiceChat 11B, một mô hình chuyển giọng nói sang giọng nói full-duplex mã nguồn mở thực hiện hiểu và tạo giọng nói trực tuyến trong một mạng duy nhất, đạt độ trễ chuyển lượt 448 ms. Đây là mô hình full-duplex mã nguồn mở đầu tiên hỗ trợ gọi công cụ trong khi trò chuyện, sử dụng kênh phụ và thông báo chờ do nhà điều hành xác định. Mô hình chỉ dành cho các dự án thí điểm nghiên cứu, yêu cầu GPU 80 GB và chưa có API lưu trữ.
NVIDIA đã phát hành NemotronLabs VoiceChat 11B, một mô hình chuyển đổi giọng nói thành giọng nói (speech-to-speech) mã nguồn mở với 11 tỷ tham số, được thiết kế cho hội thoại song công toàn phần thời gian thực. Không giống như các hệ thống xếp tầng, nó hợp nhất khả năng hiểu và tạo lời nói trong một mạng duy nhất, loại bỏ việc điều phối nhiều mô hình và giảm độ trễ xuống còn 448 ms trên Full-Duplex-Bench 1.0. Mô hình cho phép ngắt lời (barge-in), với tỷ lệ chiếm chỗ (take-over rate) là 1,00 ở 480 ms. Mô hình cũng tiên phong trong việc gọi công cụ (tool calling) trong một mô hình song công toàn phần mã nguồn mở, phát ra các kịch bản <TOOLCALL> trên một kênh riêng biệt và sử dụng các câu giữ máy do người vận hành định nghĩa để tránh im lặng trong khi các API đang chạy. Mô hình kết hợp bộ mã hóa giọng nói Fast Conformer từ Nemotron-Speech-Streaming-En-0.6b, bộ xử lý ngôn ngữ lớn Nemotron Nano v2 và bộ giải mã văn bản thành giọng nói (TTS) của NVIDIA, được huấn luyện trên khoảng 550 nghìn giờ âm thanh. Tuy nhiên, mô hình chỉ dành cho mục đích nghiên cứu, với các hạn chế đã được ghi nhận như giới hạn ngữ cảnh âm thanh hai phút và suy giảm chất lượng sau vài lượt hội thoại. Mô hình yêu cầu một GPU 80 GB (ví dụ: A100, H100, RTX 6000 Pro hoặc B200) và không có API lưu trữ. Các ràng buộc bao gồm tối đa năm công cụ mỗi phiên và hệ thống chỉ chấp nhận prompt chỉ gồm ký tự ASCII. Điểm hiệu suất bao gồm 58,5% khi gọi công cụ đơn giản trên AU Harness BFCL-v3 và 82,5% khi chọn công cụ trên Full-Duplex-Bench v3. Mô hình xếp thứ hai trong số các mô hình song công toàn phần mã nguồn mở trên VoiceBench và Full-Duplex-Bench 1.0.
Nguồn: MarkTechPost —
bản gốc
