Yandex entrena su altavoz inteligente con nuevos comandos rápidos sin perder calidad en los antiguos
Яндекс
Yandex ha añadido nuevos comandos rápidos ('me gusta', 'no me gusta', 'activar Bluetooth', 'desactivar Bluetooth') a su altavoz inteligente sin degradar los comandos existentes. Un enfoque modular de expansión de red reutilizó representaciones internas del modelo base congelado, reduciendo el uso de CPU en un 35 %, la RAM en un 50 % y las activaciones falsas en un 60 %.
El altavoz inteligente de Yandex (p. ej., Station Street) admite comandos rápidos — frases cortas como 'siguiente' o 'más bajo' — que evitan la palabra de activación 'Alice' y se ejecutan localmente en el dispositivo. Para añadir nuevos comandos sin perjudicar a los antiguos, el equipo rechazó el reentrenamiento completo (riesgo de regresión), modelos pequeños separados (ineficientes y redundantes) y métodos clásicos de aprendizaje continuo como EWC (sin garantías). En su lugar, utilizaron una expansión modular de la red: a partir de una cierta capa del modelo original congelado, una rama paralela extrae activaciones, calcula un pequeño vector aditivo y lo concatena en cada paso. Esto permite aprender nuevos comandos mientras se conservan los antiguos, con control total sobre la memoria y el cómputo. El entrenamiento constó de dos etapas: preentrenamiento en 60–100 millones de registros ASR no curados y ajuste fino en 400.000–1 millón de grabaciones limpias del hogar. Resultados: la carga de CPU se redujo en un 35%, la RAM en un 50% y las activaciones falsas disminuyeron en un 60%. El trabajo se publicó en Interspeech 2026.
Fuente: Habr — хаб ML —
original
