OpenAI chuẩn bị một cuộc cách mạng giao diện giọng nói: Thiết bị mới và Chế độ Giọng nói trong ChatGPT

OpenAIOpenAI
OpenAI, hợp tác với Sam Altman và Jony Ive, đang phát triển một thiết bị tập trung vào giọng nói mới, có khả năng là một loa thông minh. Trong khi đó, công ty đã phát hành Chế độ Giọng nói trong ChatGPT, cho phép trò chuyện tự nhiên thời gian thực với độ trễ tối thiểu, có thể thay thế các phương thức nhập liệu truyền thống như bàn phím và chuột.
Các báo cáo gần đây cho thấy Sam Altman và Jony Ive đang hợp tác trong một dự án liên quan đến thiết bị phần cứng mới, hiện được tiết lộ là một loa thông minh tập trung vào tương tác giọng nói. Mặc dù thị trường loa thông minh đã rất đông đúc, điểm khác biệt chính là Chế độ Giọng nói (Voice Mode) mới của ChatGPT do OpenAI phát triển. Không giống như tính năng đọc chính tả đơn giản, Chế độ Giọng nói liên tục lắng nghe, phản hồi gần như ngay lập tức và thậm chí có thể nói đè lên người dùng, tạo ra một luồng hội thoại tự nhiên. Người dùng nhận thấy nó hữu ích như một gia sư ngôn ngữ và công cụ dịch thuật. Sự kết hợp giữa thiết bị này và Chế độ Giọng nói cho thấy OpenAI đang hướng tới việc biến giọng nói thành phương thức nhập liệu chính cho máy tính, có khả năng thay thế bàn phím và chuột. Sự chuyển đổi này sẽ đòi hỏi trí tuệ nhân tạo thích ứng với giọng nói của con người, thay vì con người phải học cách sử dụng các thiết bị nhập liệu. Cuối cùng, giọng nói có thể là bước đầu tiên hướng tới một giao diện người-máy tự nhiên hơn, đa phương thức, tích hợp camera, cử chỉ và nhận thức ngữ cảnh. Siri được ghi nhận là người tiên phong trong tương tác giọng nói, nhưng các mô hình ngôn ngữ lớn hiện đại đã tiến bộ vượt bậc. Nếu xu hướng này tiếp diễn, bàn phím có thể trở thành công cụ chuyên dụng cho các chuyên gia, và giao diện giọng nói sẽ trở thành làn sóng lớn tiếp theo cho các công ty khởi nghiệp.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới