Точность 80% , это выше чем у Qwen3-Omni (70%) и Kimi-Audio (62%). На бенчмарке Arena Hard Audio модель взяла 75% побед в слепых сравнениях. Ближайший ориентир , Gemini-3-Flash-preview с 77,5%. Для российского продукта такой результат сравнимый с мировыми флагманами.
Ключевая фишка , работа с длинными записями до трёх часов. Можно спросить о чём говорили на совещании в районе сороковой минуты. Попросить пересказ с таймкодами. Найти момент когда обсуждался конкретный вопрос. GigaChat различает голоса разных спикеров и помнит факты из прошлых диалогов. Спросил про отпуск в одном разговоре , через неделю он напомнит.
Сбер выложил две модели в open-source. GigaChat3.1-Audio-10B , облегчённая версия для русского и английского. GigaAM Multilingual , первая российская открытая multilingual модель распознавания речи. Поддерживает русский, английский, казахский, киргизский и узбекский. Уровень ошибок в полтора-два раза ниже ближайших аналогов.
Обе модели на GitVerse и Hugging Face. Научные статьи по ним приняли на Interspeech 2026 , главную мировую конференцию по речевым технологиям. Открытый код значит что любой стартап или компания могут встроить модели в свой продукт: колл-центры, расшифровку подкастов, голосовых ассистентов на пяти языках.
Это не просто обновление чат-бота. Сбер открывает технологический задел для всего рынка. Редкий для российских компаний шаг, особенно сейчас когда государство обсуждает налоговые льготы для ИИ-отрасли.