Система, взаимодействующая с пользователем через речь, объединяющая распознавание речи (STT), понимание запроса и синтез голосового ответа (TTS).
Голосовой ассистент — это система, позволяющая пользователю взаимодействовать с сервисом или устройством посредством устной речи, а не текстового ввода. Технически это обычно конвейер из нескольких компонентов: сначала речь пользователя преобразуется в текст (STT — распознавание речи), затем текст обрабатывается моделью для понимания запроса и формирования ответа, и наконец текстовый ответ преобразуется обратно в устную речь (TTS — синтез речи).
Ранние голосовые ассистенты были ограничены обработкой заранее заданного набора команд и фраз. Современные голосовые ассистенты всё чаще строятся на основе крупных языковых моделей, что позволяет им поддерживать более естественный, свободный диалог и отвечать на широкий круг вопросов, а не только выполнять фиксированный набор команд.
В корпоративных сценариях голосовые ассистенты активно применяются в колл-центрах для автоматической первичной обработки звонков клиентов и в голосовом управлении устройствами и приложениями.
По сути да, только взаимодействие происходит голосом, а не текстом, что добавляет два дополнительных технологических компонента — распознавание речи (STT) и синтез речи (TTS).
Нет, более простые системы работают на основе распознавания заранее заданного набора команд без полноценного понимания свободной речи, но современные продукты всё чаще опираются на LLM.
Ошибка может произойти на любом из трёх этапов: неточное распознавание речи (STT), неправильное понимание смысла запроса моделью, либо ограничения самой системы по кругу поддерживаемых тем.