Команда технологий голосового ввода Яндекса придумала способ добавлять в умные устройства новые голосовые команды без забывания старых Это классическая проблема непрерывного обучения, рассказали в ML Underhood. Чтобы устройство начало понимать новые команды, модель распознавания речи нужно дообучить. Но после обновления она может начать хуже распознавать знакомые фразы. Стандартные методы вроде EWC пытаются удерживать параметры модели рядом с исходными значениями. Однако результат зависит от настройки ограничений, а гарантировать сохранение качества старых команд всё равно нельзя. Исследователи Яндекса предложили другой подход — модульное расширение сети. Основную модель полностью замораживают, поэтому она продолжает отвечать за старые команды без изменений. Легковесные модули переиспользуют информацию из активаций старых слоёв и учатся распознавать новые команды. Поскольку параметры основной модели не меняются, качество старых команд сохраняется за счёт самой архитектуры, а не подбора настроек обучения. Подход проверили на открытом наборе Google Speech Commands. В пяти отдельных экспериментах модель обучали распознавать новую пару команд, сохраняя поддержку восьми уже известных. Средняя доля пропущенных новых команд снизилась с 6,46% до 4,37% по сравнению с отдельной моделью с тем же бюджетом дополнительных параметров. Модульное расширение также превзошло адаптеры и LoRA по качеству и количеству вычислений. В результате получился практичный способ обновлять голосовые устройства с ограниченными ресурсами процессора и памяти: новые сценарии можно дополнять компактными модулями, не переобучая всю модель и не рискуя уже работающими функциями. Статью Scalable Keyword Spotting via Modular Network Expansion приняли на Interspeech 2026. Конференция пройдёт с 27 сентября по 1 октября в Сиднее. https://habr.com/ru/companies/yandex/articles/1061968