Команда технологий голосового ввода Яндекса придумала способ добавлять в умные устройства новые голосовые команды без забывания старых Это классическая проблема непрерывного обучения, рассказали в ML Underhood. Чтобы устройство начало понимать новые команды, модель распознавания речи нужно дообучить. Но после обновления она может начать хуже распознавать знакомые фразы. Стандартные методы вроде EWC пытаются удерживать параметры модели рядом с исходными значениями. Однако результат зависит от настройки ограничений, а гарантировать сохранение качества старых команд всё равно нельзя. Исследователи Яндекса предложили другой подход — модульное расширение сети. Основную модель полностью замораживают, поэтому она продолжает отвечать за старые команды без изменений. Легковесные модули переиспользуют информацию из активаций старых слоёв и учатся распознавать новые команды. Поскольку параметры основной модели не меняются, качество старых команд сохраняется за счёт самой архитектуры, а не подбора настроек обучения. Подход проверили на открытом наборе Google Speech Commands. В пяти отдельных экспериментах модель обучали распознавать новую пару команд, сохраняя поддержку восьми уже известных. Средняя доля пропущенных новых команд снизилась с 6,46% до 4,37% по сравнению с отдельной моделью с тем же бюджетом дополнительных параметров. Модульное расширение также превзошло адаптеры и LoRA по качеству и количеству вычислений. В результате получился практичный способ обновлять голосовые устройства с ограниченными ресурсами процессора и памяти: новые сценарии можно дополнять компактными модулями, не переобучая всю модель и не рискуя уже работающими функциями. Статью Scalable Keyword Spotting via Modular Network Expansion приняли на Interspeech 2026. Конференция пройдёт с 27 сентября по 1 октября в Сиднее. https://habr.com/ru/companies/yandex/articles/1061968
Команда технологий голосового ввода Яндекса придумала способ добавлять в умные…
Из этого канала
- #9604⚡️ Вышел Claude Opus 5 На многих бенчмарках модель обходит Fable: в том числе…
⚡️ Вышел Claude Opus 5 На многих бенчмарках модель обходит Fable: в том числе на ARC-AGI-3, DeepSWE и BrowseComp.
- #9611Хммм, надеюсь таблицу не Opus 5 делал 😵
Хммм, надеюсь таблицу не Opus 5 делал 😵
- #9600В сообществе взлетел новый проект создателя Твиттера Джека Дорси – Buzz 🐝 Это…
В сообществе взлетел новый проект создателя Твиттера Джека Дорси – Buzz 🐝 Это опенсорсный децентрализованный воркспейс для совместной работы людей и агентов.
- #9596"Как вы думаете, сколько ваших коллег или знакомых за последний год дописали в…
"Как вы думаете, сколько ваших коллег или знакомых за последний год дописали в резюме ""умение работы с ИИ""? Скорее всего, почти все.
- #9595Sakana AI релизнули Fugu-Ultra 1.1. Это система оркестрации агентов, которая…
Sakana AI релизнули Fugu-Ultra 1.1. Это система оркестрации агентов, которая превосходит Fable и Sol Про первую версию системы мы рассказывали здесь:…