ИИ НОВОСТЬ

Сбер научил GigaChat слышать эмоции и понимать трёхчасовые записи

Сбер выкатил GigaChat Audio , нейросеть которая обрабатывает аудио без промежуточной транскрибации. Модель слышит интонации, тембр и понимает эмоции говорящего с точностью 80%.
Сбер научил GigaChat слышать эмоции и понимать трёхчасовые записи

GigaChat Audio анализирует эмоции в голосе напрямую из аудио

Точность 80% , это выше чем у Qwen3-Omni (70%) и Kimi-Audio (62%). На бенчмарке Arena Hard Audio модель взяла 75% побед в слепых сравнениях. Ближайший ориентир , Gemini-3-Flash-preview с 77,5%. Для российского продукта такой результат сравнимый с мировыми флагманами.

Ключевая фишка , работа с длинными записями до трёх часов. Можно спросить о чём говорили на совещании в районе сороковой минуты. Попросить пересказ с таймкодами. Найти момент когда обсуждался конкретный вопрос. GigaChat различает голоса разных спикеров и помнит факты из прошлых диалогов. Спросил про отпуск в одном разговоре , через неделю он напомнит.

Сбер выложил две модели в open-source. GigaChat3.1-Audio-10B , облегчённая версия для русского и английского. GigaAM Multilingual , первая российская открытая multilingual модель распознавания речи. Поддерживает русский, английский, казахский, киргизский и узбекский. Уровень ошибок в полтора-два раза ниже ближайших аналогов.

Обе модели на GitVerse и Hugging Face. Научные статьи по ним приняли на Interspeech 2026 , главную мировую конференцию по речевым технологиям. Открытый код значит что любой стартап или компания могут встроить модели в свой продукт: колл-центры, расшифровку подкастов, голосовых ассистентов на пяти языках.

Это не просто обновление чат-бота. Сбер открывает технологический задел для всего рынка. Редкий для российских компаний шаг, особенно сейчас когда государство обсуждает налоговые льготы для ИИ-отрасли.

Поделиться