Сбер представил GigaChat Audio с функцией распознавания эмоций
Сбер выпустил обновленную модель GigaChat Audio, которая обрабатывает аудиофайлы и голосовые сообщения без предварительного перевода речи в текст. Нейросеть научилась распознавать эмоции пользователя и работать с записями длиной до трех часов. Об этом «Коду Дурова» сообщили в пресс-службе компании.
GigaChat Audio определяет по интонации и голосу, с каким настроем к нему обращается пользователь, и подстраивает тон ответа. Модель может работать с аудиофайлами длиной до трех часов: искать в них конкретные моменты, пересказывать отрезки, делать краткое содержание со ссылками на таймкоды и различать голоса спикеров.
Еще одна новая функция — память по итогам голосового диалога. Модель запоминает важные факты, озвученные пользователем, и учитывает их в следующих сессиях. Зафиксированные данные можно отредактировать или отключить в настройках профиля.
По данным внутренних тестов, GigaChat Audio набрала 75% побед в сравнении ответов разных моделей. По точности распознавания эмоций модель показала 80% против 70% у Qwen3-Omni-30B и 62% у Kimi-Audio.
Сбер также выложил в открытый доступ облегченную версию GigaChat3.1-Audio-10B для разработчиков и семейство моделей распознавания речи GigaAM Multilingual. Последняя поддерживает русский, английский, киргизский, казахский и узбекский языки и допускает в 1,5–2 раза меньше ошибок, чем аналоги.
Обновленная модель уже доступна в ИИ-помощнике ГигаЧат, а ее облегченные версии — на платформах GitVerse и Hugging Face.
«Голос — самый естественный способ общения с технологией, но и самый требовательный: любая ошибка в распознавании или неверно считанная эмоция сразу разрушает доверие к ассистенту», — заявил старший вице-президент Сбербанка Антон Фролов.
Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.