Яндекс научил системы распознавания голосовых команд не забывать старые запросы

Вчера, Редакция Рунет | 👁 3386

Яндекс научил системы распознавания голосовых команд не забывать старые запросы

Исследователи Яндекса разработали метод, который позволяет обновлять список ключевых слов-триггеров в умных устройствах без потери способности распознавать уже известные команды. Научное исследование с описанием подхода принято на международную конференцию Interspeech 2026, которая пройдёт с 27 сентября по 1 октября в Сиднее. Об этом сообщает Telegram-канал «Яндекс».

«Производителям умных колонок, автомобильных ассистентов и другой техники с голосовым управлением приходится регулярно расширять набор фраз, которые устройство понимает автономно, без интернета», — заявили исследователи Яндекса.

Обычно для этого модель распознавания речи нужно дообучать. Однако после этого устройство может начать хуже распознавать уже знакомые команды. В машинном обучении этот эффект называют «катастрофическим забыванием».

Существующие методы непрерывного обучения, например, эластичное закрепление весов (EWC), позволяют уменьшить этот эффект, но не устраняют его полностью. Исследователи Яндекса предложили другой подход — модульное расширение модели. Он не только решает проблему «катастрофического забывания», но и требует меньшего количества вычислений, чем другие методы, например, низкоранговая адаптация (LoRA) и адаптеры.

Суть метода Яндекса в том, что вместо изменения всей уже работающей нейросети к ней добавляется небольшой новый модуль — дополнительная обучаемая ветка, которая отвечает за распознавание новых команд. Эта ветка использует промежуточные признаки, которые уже извлекает основная модель, но имеет собственный классификатор для новых команд. При этом параметры базовой модели остаются неизменными, включая параметры нормализации и основной классификатор. Поэтому результаты её работы для старых команд остаются такими же, как до обновления. Новые команды добавляются только за счёт обучения дополнительного модуля, а не перестройки всей системы.

Новый метод требует небольшого увеличения размера нейросети — итоговый рост составляет менее 10%. Эффективность подхода исследователи проверили на открытом датасете Google Speech Commands. В экспериментах модель должна была научиться новым парам команд, сохранив работу с уже поддерживаемыми словами. Новый метод снизил с 6,46% до 4,37% среднюю долю пропущенных новых команд по сравнению с отдельной моделью аналогичного размера и превзошёл методы адаптеров и LoRA. Для сравнения, при обычном полном дообучении всей модели она хорошо усваивала новые команды, но гораздо хуже распознавала старые: средняя доля пропущенных команд из уже известных возрастала с 2,71% до 69,08%.

По мнению исследователей, такой подход может использоваться в умных колонках, бытовой технике, автомобильных голосовых помощниках и других устройствах с ограниченными вычислительными ресурсами.

Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.

Комментарии 0
Зарегистрируйтесь или , чтобы оставлять комментарии.
Российские регистраторы доменов просят Минцифры отсрочить введение ЕСИА