Современные нейросети умеют не просто озвучивать текст механическим голосом, а воспроизводить реальный тембр конкретного человека по короткому образцу записи. Разбираем, как устроена эта технология, где она законно применяется в бизнесе и творчестве, и почему к ней приковано внимание в контексте мошенничества.
Базовый синтез речи (text-to-speech) превращает написанный текст в озвучку одним из готовых голосов — эта технология используется давно, например в навигаторах и озвучке статей. Клонирование голоса — более продвинутая технология: модель анализирует образец записи конкретного человека и учится воспроизводить его тембр, интонации и манеру речи для озвучки любого нового текста.
Технология легально используется для озвучки аудиокниг голосом автора без необходимости самому читать весь текст, локализации видео на разные языки с сохранением голоса ведущего, озвучки корпоративных обучающих материалов и голосовых помощников. Во всех этих случаях ключевое условие — явное согласие человека, чей голос клонируется.
ElevenLabs — один из самых известных сервисов клонирования голоса с поддержкой множества языков, включая русский. В России развиваются собственные решения на базе YandexGPT и GigaChat для озвучки текста корпоративным голосом бренда. Выбор сервиса обычно зависит от требуемого языка, качества эмоциональной окраски речи и бюджета проекта.
Обратная сторона технологии — использование клонированного голоса для мошенничества, например, поддельных звонков «от имени» родственника с просьбой о срочном переводе денег. Из-за этого стоит с осторожностью относиться к неожиданным голосовым сообщениям с просьбами о деньгах, даже если голос кажется полностью узнаваемым, и по возможности перепроверять такие просьбы другим каналом связи.
Нет, клонирование голоса конкретного человека без его согласия является нарушением его прав и в ряде случаев может использоваться в мошеннических схемах, что уже привлекает внимание правоохранительных органов.
Современным сервисам может хватить нескольких секунд или минут чистой записи, хотя для более естественного результата с широким диапазоном интонаций обычно нужно больше исходного материала.
На слух это становится всё сложнее — в сомнительных случаях, особенно при просьбах о деньгах или срочных действиях, стоит перепроверять информацию через другой канал связи, а не полагаться только на голос.
Для озвучки аудиокниг, локализации видео на другие языки с сохранением голоса ведущего, а также для корпоративных голосовых ассистентов — во всех случаях с согласия владельца голоса.
Да, ведущие международные сервисы вроде ElevenLabs поддерживают русский язык, а также развиваются отечественные решения на базе российских языковых моделей.