GigaAM — семейство открытых акустических моделей SberDevices для распознавания русской речи и эмоций: компактная альтернатива Whisper с более высокой точностью на русскоязычных данных.
В семейство GigaAM входят базовая акустическая модель, предобученная на разнообразной русской речи, GigaAM-CTC для распознавания речи (ASR) и GigaAM-Emo для определения эмоций в голосе. Архитектурная основа — Conformer, с 220–240 млн параметров в зависимости от конфигурации.
GigaAM v3 — SOTA-модель (state-of-the-art) для русского языка: она заметно точнее Whisper Large на русскоязычных датасетах, при этом занимая всего 220 млн параметров против 1,55 млрд у Whisper Large — то есть примерно в 7 раз компактнее при более высоком качестве распознавания.
В апреле 2026 года модели GigaAM получили дообучение (CTC/RNNT) со словными таймстампами и поддержкой Triton Inference Server для промышленного развёртывания. Обучающие данные GigaAM-v3 расширены новыми доменами — колл-центры, музыка, атипичная речь, голосовые сообщения, — что дало в среднем 30% улучшение метрики WER на новых доменах. В июле 2026 года Сбер выложил в открытый доступ GigaAM Multilingual — первую модель семейства с поддержкой нескольких языков (русский, английский, киргизский, казахский, узбекский), в компактной и флагманской версиях, доступную на GitVerse и Hugging Face.
GigaAM — открытая (некоммерческая лицензия) альтернатива зарубежному Whisper специально для русского языка, востребованная в задачах, где точность распознавания русской речи критична: колл-центры, голосовой ввод, транскрибация.
Семейство открытых акустических моделей SberDevices для распознавания русской речи и эмоций на архитектуре Conformer.
GigaAM v3 точнее Whisper Large на русскоязычных датасетах, занимая в 7 раз меньше параметров (220 млн против 1,55 млрд).
Некоммерческая лицензия — модели находятся в открытом доступе для исследовательского и некоммерческого использования.
Добавлены словные таймстампы, поддержка Triton Inference Server и обучение на новых доменах (колл-центры, музыка, голосовые сообщения) с улучшением WER на 30%.
Для распознавания русской речи (ASR) и эмоций — в колл-центрах, голосовом вводе, транскрибации и анализе звонков.