GigaAM: обзор акустических моделей распознавания речи — AI Радар 2026
Главная / Карта ИИ / GigaAM
Инфраструктура

GigaAM: обзор акустических моделей распознавания речи

Обновлено 15 июля 2026Александр ГригорьевИнфраструктура

GigaAM — семейство открытых акустических моделей SberDevices для распознавания русской речи и эмоций: компактная альтернатива Whisper с более высокой точностью на русскоязычных данных.

220–240 млн параметров
Размер модели
в 7 раз компактнее Whisper Large
Эффективность
Некоммерческая лицензия
Условия использования
✕ Не в реестре отечественного ПО
Открыть GigaAM → Карта ИИ →

Семейство моделей

В семейство GigaAM входят базовая акустическая модель, предобученная на разнообразной русской речи, GigaAM-CTC для распознавания речи (ASR) и GigaAM-Emo для определения эмоций в голосе. Архитектурная основа — Conformer, с 220–240 млн параметров в зависимости от конфигурации.

Точность и сравнение с Whisper

GigaAM v3 — SOTA-модель (state-of-the-art) для русского языка: она заметно точнее Whisper Large на русскоязычных датасетах, при этом занимая всего 220 млн параметров против 1,55 млрд у Whisper Large — то есть примерно в 7 раз компактнее при более высоком качестве распознавания.

Обновления v3 (2026)

В апреле 2026 года модели GigaAM получили дообучение (CTC/RNNT) со словными таймстампами и поддержкой Triton Inference Server для промышленного развёртывания. Обучающие данные GigaAM-v3 расширены новыми доменами — колл-центры, музыка, атипичная речь, голосовые сообщения, — что дало в среднем 30% улучшение метрики WER на новых доменах. В июле 2026 года Сбер выложил в открытый доступ GigaAM Multilingual — первую модель семейства с поддержкой нескольких языков (русский, английский, киргизский, казахский, узбекский), в компактной и флагманской версиях, доступную на GitVerse и Hugging Face.

Место на карте рынка

GigaAM — открытая (некоммерческая лицензия) альтернатива зарубежному Whisper специально для русского языка, востребованная в задачах, где точность распознавания русской речи критична: колл-центры, голосовой ввод, транскрибация.

Частые вопросы

Что такое GigaAM?

Семейство открытых акустических моделей SberDevices для распознавания русской речи и эмоций на архитектуре Conformer.

Чем GigaAM лучше Whisper на русском языке?

GigaAM v3 точнее Whisper Large на русскоязычных датасетах, занимая в 7 раз меньше параметров (220 млн против 1,55 млрд).

Какая лицензия у GigaAM?

Некоммерческая лицензия — модели находятся в открытом доступе для исследовательского и некоммерческого использования.

Что изменилось в GigaAM v3 (2026)?

Добавлены словные таймстампы, поддержка Triton Inference Server и обучение на новых доменах (колл-центры, музыка, голосовые сообщения) с улучшением WER на 30%.

Для каких задач используют GigaAM?

Для распознавания русской речи (ASR) и эмоций — в колл-центрах, голосовом вводе, транскрибации и анализе звонков.

Как сослаться на эти данные
Radarii.ru, «GigaAM: обзор акустических моделей распознавания речи», обновлено 15 июля 2026. Ссылка: radarii.ru/companies/gigaam