Yandex、スマートスピーカーに新しい高速コマンドを追加、既存の品質を維持
Яндекс
Yandexは、スマートスピーカーに「いいね」「よくない」「Bluetoothをオン」「Bluetoothをオフ」といった新しい高速コマンドを追加しましたが、既存のコマンドの品質は低下しませんでした。モジュール式ネットワーク拡張アプローチにより、凍結されたベースモデルの内部表現を再利用し、CPU使用率を35%、RAM使用量を50%、誤起動を60%削減しました。
ヤンデックスのスマートスピーカー(例:Station Street)は、アクティベーションワードの「アリス」を経由せずにデバイス上でローカル実行される「次へ」や「小さくして」といった短いフレーズの高速コマンドをサポートしています。既存のコマンドを損なわずに新しいコマンドを追加するため、チームは完全な再学習(リグレッションのリスク)、個別の小さなモデル(非効率的で冗長)、および弹性重み付け統合(Elastic Weight Consolidation、EWC)のような古典的な継続学習手法(保証がない)を却下しました。代わりに、モジュラーネットワーク拡張を採用しました。凍結された元のモデルの特定の層から、並列ブランチがアクティベーションを抽出し、小さな加法ベクトルを計算し、各ステップでそれを連結します。これにより、古いコマンドを保持しながら新しいコマンドを学習でき、メモリと計算を完全に制御できます。トレーニングは2段階で行われました。最初に6000万~1億の非キュレートASRログで事前学習し、次に40万~100万のクリーンな家庭内録音でファインチューニングしました。結果はCPU負荷が35%、RAMが50%削減され、誤アクティベーションが60%減少しました。この研究はInterspeech 2026で発表されました。
出典: Habr — хаб ML —
原文
