ByteDance Seed ra mắt SeedRealtime: Mô hình ngôn ngữ lớn nghe - nhìn song công toàn phần, quan sát, lắng nghe và nói chuyện trong một mô hình duy nhất
ByteDance
Nhóm Seed của ByteDance đã giới thiệu SeedRealtime, một mô hình ngôn ngữ lớn song công toàn phần nghe - nhìn bản địa, tích hợp âm thanh, video và văn bản trong một kiến trúc thống nhất để tương tác đa phương thức liên tục theo thời gian thực. Mô hình này nhằm thay thế các quy trình xử lý theo tầng ASR, VLM và TTS bằng một mô hình đầu cuối duy nhất, cho phép chủ động phát biểu và chuyển lượt tự nhiên. Hiện mô hình đã được triển khai trong ứng dụng Doubao của ByteDance, nhưng chưa công bố báo cáo kỹ thuật, tham số, trọng số hay API nào.
Nhóm Seed của ByteDance vừa công bố SeedRealtime, một mô hình ngôn ngữ lớn (LLM – large language model) song công toàn phần (full-duplex) tích hợp âm thanh và hình ảnh gốc, kết hợp âm thanh, video và văn bản trong một kiến trúc đầu-cuối (end-to-end) duy nhất. Khác với các hệ thống dạng chuỗi truyền thống nối tiếp các mô-đun nhận dạng giọng nói tự động (ASR – automatic speech recognition), mô hình ngôn ngữ thị giác (VLM – vision-language model) và chuyển văn bản thành giọng nói (TTS – text-to-speech), SeedRealtime thực hiện đồng thời các quá trình nhận thức, hiểu, ra quyết định và biểu đạt, đồng thời tự xử lý việc luân phiên lượt nói (turn-taking) ở bên trong, loại bỏ nhu cầu sử dụng bộ phát hiện hoạt động giọng nói (voice-activity detector) từ bên ngoài. Công ty cho biết có ba đột phá chính: khả năng hiểu kết hợp âm thanh-hình ảnh, tương tác chủ động, và nhịp điệu hội thoại tự nhiên. Trong các buổi trình diễn, mô hình đã thành công trong việc khớp tên với khuôn mặt trong môi trường ồn ào, chủ động nhắc nhở người dùng khi một vật thể cụ thể xuất hiện trong khung hình camera, chỉnh sửa các bước pha espresso dựa trên trạng thái hình ảnh quan sát được, và loại bỏ những đoạn trò chuyện không liên quan trong khi vẫn ghi nhớ thông tin nằm ngoài khung hình. SeedRealtime hiện đang được triển khai trong ứng dụng Doubao của ByteDance, nhưng công ty chưa công bố báo cáo kỹ thuật, số lượng tham số, trọng số mở (open weights) hay giao diện lập trình ứng dụng (API – application programming interface), khiến mô hình này chưa thể được các bên thứ ba tích hợp sử dụng. Theo đánh giá nội bộ của ByteDance, các vấn đề về nhịp điệu hội thoại đã giảm một nửa so với các hệ thống dạng chuỗi, tuy nhiên công ty không cung cấp số liệu benchmark hay độ trễ cụ thể.
Nguồn: MarkTechPost —
bản gốc
