Сбер выпустил GigaChat Audio: нейросеть распознает эмоции и обрабатывает аудио до трех часов
Сбер представил обновленную нейросеть GigaChat Audio, которая теперь способна распознавать эмоции пользователя по интонации и обрабатывать аудиофайлы без предварительного преобразования речи в текст. Модель доступна в открытом доступе под лицензией MIT.
Нейросеть GigaChat Audio, работающая на базе GigaChat 3.1 и аудиоэнкодера GigaAM Multilingual, анализирует интонацию, тембр и произношение, определяя позитивную или негативную эмоцию пользователя. По внутренним тестам, точность распознавания эмоций достигает 80%, что выше показателей аналогов (Qwen3-Omni-30B — 70%, Kimi-Audio — 62%). Это позволяет ИИ-помощнику «ГигаЧат» реагировать уместнее: мягче отвечать раздраженному пользователю или поддерживать настроение при хороших новостях.
Модель может обрабатывать аудиозаписи длиной до трех часов и ориентироваться внутри них: пользователь может спросить, в какой момент обсуждался конкретный вопрос, попросить пересказать отдельный отрезок или получить саммари всей записи со ссылками на таймкоды. Нейросеть также различает голоса разных спикеров (диаризация). Эти возможности полезны для разбора совещаний, звонков и протоколирования.
Кроме того, GigaChat Audio получил долговременную память: ИИ-помощник запоминает важные факты из голосового диалога и учитывает их в следующих сессиях. Например, при повторном обращении он будет опираться на ранее озвученные пожелания. Модель опубликована на Hugging Face и GitHub под лицензией MIT. Также Сбер выложил в открытый доступ семейство моделей распознавания речи GigaAM Multilingual, поддерживающее русский, английский, казахский, киргизский и узбекский языки. По заявлению компании, количество ошибок у GigaAM в 1,5–2 раза ниже, чем у ближайших аналогов, а компактная версия с 240 млн параметров обгоняет Whisper Large v3 и Omnilingual 1B.