SaluteSpeech — API Сбера на основе моделей семейства GigaAM с обработкой данных внутри России и автоматической расстановкой пунктуации. Актуальная линейка GigaAM-v3 включает четыре модели — быстрые CTC-версии и более точные RNN-T, в end-to-end формате с BPE-токенизацией.
Yandex SpeechKit — сервис распознавания и синтеза речи Яндекса, давно используется в собственных продуктах компании (включая Алису) и доступен как отдельный API для сторонних разработчиков.
На основе SaluteSpeech и GigaChat уже построены готовые продукты для протоколирования встреч — не просто транскрипция, а структурированный протокол с темами, решениями и ответственными. Для типовых задач также называют несколько специализированных сервисов — но при выборе стоит проверять точность на собственных записях, а не на маркетинговых примерах поставщика.
Как и у любой системы распознавания речи, точность падает при плохом качестве связи, сильных шумах и наложении голосов нескольких участников. Разумно протестировать кандидата на собственной, не идеальной записи звонка — а не на демонстрационном примере с чистым звуком.