Яндекс научил колонки новым быстрым командам без потери качества старых

ЯндексЯндекс
Яндекс разработал модульный подход для добавления в умные колонки новых голосовых команд, таких как «лайк», «дизлайк» и «включи/выключи блютус», без ухудшения распознавания старых команд. Метод основан на расширении сети (Modular Network Expansion), который использует замороженную базовую модель и обучает только дополнительные легковесные ветки, что снижает ложные срабатывания на 60%, потребление CPU на 35% и RAM на 50%.
Яндекс описал метод добавления новых быстрых команд в умные колонки без ущерба для уже работающих. Быстрые команды (например, «дальше», «тише») обрабатываются компактной нейросетью прямо на устройстве без активационного слова «Алиса». Для добавления команд «лайк», «дизлайк», «включи блютус» и «выключи блютус» требовалось избежать регрессии качества старых. Команда выбрала модульное расширение сети: начиная с определённого слоя замороженной базовой модели отводится параллельная ветка, где активации дополняются небольшими обучаемыми векторами. Это позволило новым слоям использовать знания старой модели, не тратя ёмкость на повторение. Подход снизил количество ложных срабатываний примерно на 60%, потребление CPU — на 35%, а RAM — на 50%. Данные для обучения собирали в два этапа: претрейн на 60–100 млн неочищенных ASR-логов и дообучение на 400 тыс. – 1 млн специально записанных в квартирах примерах. Результаты работы приняты на Interspeech 2026.
Сокращения
ASR = Automatic Speech Recognition — автоматическое распознавание речи
CPU = Central Processing Unit — центральный процессор
RAM = Random Access Memory — оперативная память
PEFT = Parameter-Efficient Fine-Tuning — эффективная тонкая настройка параметров
LoRA = Low-Rank Adaptation — низкоранговая адаптация
EWC = Elastic Weight Consolidation — эластичная консолидация весов
Источник: Habr — хаб ML — оригинал

Наши прошлые публикации по теме

Есть свежие новости