Yandex huấn luyện loa thông minh với lệnh nhanh mới mà không làm giảm chất lượng các lệnh cũ
Яндекс
Yandex đã bổ sung các lệnh nhanh mới ("thích", "không thích", "bật Bluetooth", "tắt Bluetooth") vào loa thông minh mà không làm suy giảm các lệnh hiện có. Phương pháp mở rộng mạng mô-đun đã tái sử dụng các biểu diễn nội bộ của mô hình cơ sở bị đóng băng, giảm 35% mức sử dụng CPU, 50% RAM và 60% số lần kích hoạt sai.
Loạt loa thông minh của Yandex (ví dụ: Station Street) hỗ trợ các lệnh nhanh — những cụm từ ngắn như 'tiếp theo' hoặc 'nhỏ hơn' — bỏ qua từ kích hoạt 'Alice' và chạy trực tiếp trên thiết bị. Để thêm lệnh mới mà không làm hỏng các lệnh cũ, nhóm nghiên cứu đã loại bỏ phương pháp huấn luyện lại toàn bộ (nguy cơ suy thoái), các mô hình nhỏ riêng biệt (kém hiệu quả và dư thừa), cũng như các phương pháp học liên tục cổ điển như Elastic Weight Consolidation (không có đảm bảo). Thay vào đó, họ sử dụng phương pháp mở rộng mạng mô-đun: bắt đầu từ một lớp nhất định của mô hình gốc đã bị đóng băng, một nhánh song song trích xuất các kích hoạt, tính toán một vector cộng dồn nhỏ và nối nó vào mỗi bước. Điều này cho phép học các lệnh mới trong khi vẫn giữ nguyên các lệnh cũ, với quyền kiểm soát hoàn toàn về bộ nhớ và tính toán. Quá trình huấn luyện gồm hai giai đoạn — tiền huấn luyện trên 60–100 triệu bản ghi nhật ký nhận dạng giọng nói tự động không qua tinh chỉnh và tinh chỉnh trên 400.000–1 triệu bản ghi âm trong nhà sạch. Kết quả: tải CPU giảm 35%, RAM giảm 50% và số lần kích hoạt sai giảm 60%. Công trình này đã được công bố tại Interspeech 2026.
Nguồn: Habr — хаб ML —
bản gốc
