Otter.ai и похожие западные сервисы (Fireflies, Voicea) не работают без VPN и заметно хуже распознают русскую речь. SaluteSpeech и Yandex SpeechKit решают обе проблемы — работают напрямую из России и обучены на русском языке.
SaluteSpeech — API Сбера на основе моделей семейства GigaAM с обработкой данных внутри России и автоматической расстановкой пунктуации. Актуальная линейка GigaAM-v3 включает четыре модели — быстрые CTC-версии и более точные RNN-T, в end-to-end формате с BPE-токенизацией.
Yandex SpeechKit — сервис распознавания и синтеза речи Яндекса, давно используется в собственных продуктах компании (включая Алису) и доступен как отдельный API для сторонних разработчиков.
На основе SaluteSpeech и GigaChat уже построены готовые продукты для протоколирования встреч — не просто транскрипция, а структурированный протокол с темами, решениями и ответственными. Для типовых задач также называют несколько специализированных сервисов — но при выборе стоит проверять точность на собственных записях, а не на маркетинговых примерах поставщика.
Как и у любой системы распознавания речи, точность падает при плохом качестве связи, сильных шумах и наложении голосов нескольких участников. Разумно протестировать кандидата на собственной, не идеальной записи звонка — а не на демонстрационном примере с чистым звуком.
Сервис не работает без VPN и хуже распознаёт русскую речь по сравнению со специализированными на русском языке моделями.
Зависит от качества записи и версии модели (CTC быстрее, RNN-T точнее) — стоит протестировать на собственных записях встреч, а не на демо-примерах.
Нет, оба сервиса работают напрямую из России.
Да, на базе SaluteSpeech и GigaChat уже есть сервисы, которые сразу формируют структурированный протокол с темами, решениями и ответственными.
Как и у любой системы распознавания речи, точность падает при сильных шумах и наложении голосов — сравнивайте на собственных, а не идеальных записях.