Ещё в 2024 году генерация видео нейросетью означала пятисекундный ролик с оплывающими лицами и предметами, которые случайным образом исчезают между кадрами. За полтора года индустрия прошла путь от занятного демо до инструмента, которым реально пользуются в продакшене: рекламные агентства собирают черновые аниматики за часы вместо недель, SMM-специалисты делают десятки вариантов ролика для тестов, а ютуб-каналы и блогеры на полном серьёзе снимают часть контента без камеры вообще.
Три релиза 2026 года задали новую планку качества. Google выпустила Veo 3.1 с честным 4K и встроенной генерацией диалогов и звуковых эффектов. Kuaishou обновила китайскую Kling до версии 3.0 с нативным 4K при 60 кадрах в секунду и многосценовым повествованием на шесть связанных кадров. OpenAI выпустила Sora 2 и Sora 2 Pro — и именно с ней связан главный сюжет года: 24 марта 2026 года OpenAI объявила о закрытии сервиса, 26 апреля отключила потребительское приложение и веб-версию, а API для разработчиков доработает до 24 сентября 2026 года. Причины — высокие вычислительные затраты, смещение фокуса компании на корпоративные продукты и более медленный, чем ожидалось, рост пользовательской базы.
Для российской аудитории эта нестабильность рынка совмещается со старой проблемой — доступностью. Из семи разобранных в этом материале инструментов без VPN напрямую работают только два — китайская Kling и российский Kandinsky Video. Остальные требуют либо VPN и зарубежную карту, либо российского агрегатора нейросетей с наценкой посредника. Дальше в статье — детальный разбор каждой модели, сравнительная таблица и практический гайд, как сгенерировать первое видео, не упираясь в блокировки.
В основе почти всех современных генераторов видео — диффузионные модели, те же, что стоят за генерацией изображений в Midjourney или Kandinsky. Модель обучена на огромном массиве видео восстанавливать чистое изображение из зашумлённого, шаг за шагом убирая «шум» в направлении, заданном текстовым описанием. Ключевое отличие видео от картинки — необходимость держать не только пространственную согласованность (объект выглядит правильно в кадре), но и временную: тот же объект должен оставаться собой на протяжении десятков кадров, двигаться физически правдоподобно и не «плыть» между сценами.
Решают это по-разному: одни модели генерируют видео как единую 3D-структуру пространство-время сразу, другие — покадрово с механизмами внимания, которые «помнят» предыдущие кадры. Kling и Veo в 2026 году продвигают архитектуры, которые явно моделируют физику — траектории падения, столкновения, поведение ткани и воды, — это и называют в маркетинговых материалах «пониманием физического мира», хотя по сути это статистическая закономерность, выученная на огромном объёме реальных видео, а не физический движок в привычном смысле.
Практически все инструменты поддерживают два режима запуска. Text-to-video — генерация с нуля по текстовому описанию (промпту): вы описываете сцену, камеру, освещение, действие — модель строит видео «из головы». Image-to-video — оживление существующей картинки или фотографии: модель берёт статичное изображение как первый кадр и достраивает движение и, в некоторых случаях, звук. Второй режим обычно даёт более предсказуемый и управляемый результат, потому что композиция и объекты в кадре уже заданы человеком, а не придуманы моделью — это особенно удобно для рекламных креативов на основе существующих фото товара. Подробнее о втором подходе — в статье «Как создать видео из фото нейросетью».
Стоит держать в голове и обратную сторону этой технологии — почему хороший результат стоит так дорого. Обучение и, что важнее для пользователя, каждая отдельная генерация видео требуют на порядки больше вычислительных мощностей, чем генерация одной картинки или ответ текстовой нейросети: видео — это десятки кадров, каждый из которых должен быть согласован с соседними. Именно поэтому цена за секунду видео у топовых моделей измеряется десятками центов, а не долями цента, как у текстовых запросов, и именно высокие вычислительные затраты разработчики Sora назвали одной из причин закрытия сервиса — про это подробнее в следующем разделе.
Sora 2 вышла в начале 2026 года и почти сразу стала синонимом видео-ИИ в массовом сознании — во многом благодаря вирусному распространению коротких клипов в соцсетях и агрессивному маркетингу вокруг встроенной генерации звука и диалогов. Технически модель предлагала до 20 секунд в одной генерации с возможностью до шести последовательных расширений — то есть теоретический максимум связного ролика доходил до 120 секунд. Базовая Sora 2 работала в разрешении 720p, а платная Sora 2 Pro добавляла 1024p и полноценный 1080p в портретной и альбомной ориентации.
Ценообразование было по факту API-ориентированным: около $0.10 за секунду для обычной Sora 2 и от $0.30 до $0.70 за секунду для Pro-версии в зависимости от разрешения — 20-секундный ролик в 1080p через Pro обходился примерно в $14 по стандартному тарифу. Доступ шёл через платные подписки ChatGPT Plus ($20/мес) и ChatGPT Pro ($200/мес) либо напрямую через API с оплатой по факту использования.
А затем случилось то, ради чего этот раздел стоит читать внимательно, если вы всё ещё планируете строить продакшен-процесс вокруг Sora: 24 марта 2026 года OpenAI объявила о закрытии сервиса, сославшись на высокие вычислительные затраты и стратегический разворот компании в сторону корпоративных инструментов и агентного ИИ. Потребительское приложение и веб-версия отключились 26 апреля 2026 года — по сообщениям СМИ, партнёр студии Disney, вложивший в сотрудничество с Sora около $1 млрд, узнал о закрытии меньше чем за час до публичного объявления. API для разработчиков доработает до 24 сентября 2026 года, после чего все данные пользовательских аккаунтов будут окончательно удалены.
Практический вывод для читателя из России на момент публикации этого материала: обычному пользователю Sora уже недоступна — ни через VPN, ни как-либо ещё, потому что потребительский продукт выключен. Доступ сохраняется только у разработчиков через API и лишь до конца сентября 2026 года. Если вы встречаете в 2026 году статью или гайд, рекомендующий Sora как рабочий инструмент для съёмки контента, — эта информация, скорее всего, устарела, и стоит проверить дату публикации источника.
Veo 3.1 от Google на сегодня — самая технически сильная модель по совокупности разрешения, реализма и качества встроенного звука. Модель поддерживает вывод в 720p, 1080p и честном 4K, работает с длительностью 4, 6 или 8 секунд за одну генерацию в горизонтальной и вертикальной ориентации, а функция расширения сцены позволяет сцеплять до 20 клипов подряд, создавая ролики продолжительностью свыше 140 секунд — каждое новое расширение анализирует последнюю секунду предыдущего клипа, чтобы сохранить визуальную непрерывность. Встроенная генерация звука создаёт синхронизированные эффекты, диалоги и фоновые шумы прямо вместе с видеорядом, без отдельного этапа озвучки.
У Veo 3.1 три ценовых уровня. Стандартная версия стоит $0.40-0.75 за секунду в зависимости от того, включён ли звук — восьмисекундный ролик обойдётся в $3.20-6.00. Fast-версия дешевле, $0.10-0.15 за секунду ($0.80-1.20 за восемь секунд), а облегчённая Veo 3.1 Lite стоит меньше половины цены Fast при сопоставимой скорости — её ориентируют на разработчиков, которым нужен дешёвый массовый инструмент, а не витринное качество. Модель доступна через приложение Gemini, инструмент Flow, платформу Vertex AI и сторонние сервисы; подписка Gemini Advanced за $20/мес включает часть лимитов на генерацию, но активные пользователи выбирают их быстро.
Доступность из России — главная сложность. Сервисы Google, через которые работает Veo, не открываются без VPN и не принимают карты российских банков напрямую. Рабочий обходной путь на практике — российские агрегаторы нейросетей, которые подключаются к Veo через официальный API и берут оплату в рублях с наценкой посредника, либо связка VPN плюс зарубежная виртуальная карта, пополняемая через СБП. Оба варианта добавляют трение и стоимость по сравнению с прямой подпиской, доступной пользователям из поддерживаемых Google стран.
Kling AI от китайской Kuaishou — на сегодня, пожалуй, самый удобный вариант именно для российского пользователя, и не только по техническим характеристикам. Версия Kling 3.0 принесла нативную 4K-генерацию без потери качества при апскейле, многосценовое повествование на шесть связанных кадров и архитектуру Omni One, которая, по заявлениям разработчика, точнее моделирует физику движения на скорости до 60 кадров в секунду в 4K. Одна генерация в API ограничена 10 секундами, но при склейке нескольких клипов итоговый ролик может доходить до трёх минут.
Ценообразование кредитное и довольно гибкое: от 6 кредитов за секунду в 720p без звука до 12 кредитов за секунду с 1080p и нативным звуком, а честное 4K в линейке Kling Video 3.0 стоит 30 кредитов за секунду. Подписки — от $6.99 в месяц на тарифе Standard до $64.99 в месяц на тарифе Premier; условный тариф около $32.56 в месяц даёт порядка 3000 кредитов, что translates примерно в 6 минут видео в 720p или 4 минуты в 1080p за месяц.
Главное преимущество Kling для российской аудитории — сайт и мобильное приложение открываются без VPN, регистрация бесплатная, и по отзывам пользователей именно за реализм движения и цену относительно Sora и Veo модель особенно ценят для регулярной генерации контента под соцсети. С оплатой сложнее: официально сервис ориентирован на международные способы оплаты, поэтому пользователи из России чаще проводят платежи через российские агрегаторы нейросетей или зарубежные виртуальные карты — юридически оплата зарубежных цифровых сервисов физлицом остаётся в легальном поле, но практические риски (заморозка средств на «серой» карте, потеря доступа при передаче аккаунта посреднику) стоит учитывать.
Из других китайских моделей стоит отдельно выделить Hailuo 02 (и более новую линейку Hailuo 2.3) от MiniMax — модель с нативным 1080p, вариантами длительности 6 и 10 секунд и рекордной для индустрии ценовой эффективностью: около $0.28 за десятисекундное видео в 1080p или порядка $0.045 за секунду в 768p. По ряду независимых бенчмарков Hailuo 02 в пользовательских оценках обходит даже Veo 3 по соотношению цена/качество, хотя разрешение и длительность у неё скромнее топовых конкурентов. Доступность именно этой модели без VPN из России достоверно не проверена — относитесь к этому пункту как к ориентиру, а не факту, и проверяйте перед тем, как строить на ней рабочий процесс.
Kandinsky Video от Сбера — на сегодняшний день фактически единственный заметный российский инструмент генерации видео с открытым массовым доступом. Он развивается в рамках линейки Kandinsky вместе с моделями генерации изображений и по состоянию на 2026 год существует в нескольких вариантах: облегчённая Kandinsky Video Lite (около 2 млрд параметров, ролики до 10 секунд по текстовому запросу, распространяется по открытой лицензии, допускающей коммерческое использование), более тяжёлая Kandinsky 4.1 Video (ролики до 10 секунд в SD 720×576 или HD 1280×720 из текста или стартового кадра, с ускоренной за счёт дистилляции генерацией) и актуальная линейка Kandinsky 5.0, где отдельная модель для коротких клипов выдаёт около 5 секунд видео из текста или начального кадра.
Доступ бесплатный: разработчик заявляет 10 бесплатных генераций для пробы и по 10 генераций в день после авторизации, с возможностью нарастить дневной лимит через реферальную программу — за каждого приглашённого друга плюс 10 генераций. Без регистрации доступ идёт через Telegram-бота (в материалах разработчика фигурирует цифра до 510 генераций в час на сторону сервиса, без привязки к конкретному пользователю) и через встроенную интеграцию в GigaChat.
Честно сопоставляя с мировыми лидерами: Kandinsky Video ощутимо уступает Sora (пока она работала), Veo и Kling по трём параметрам — максимальному разрешению (нет заявленного честного 4K, максимум — HD 1280×720), длительности одной генерации (5-10 секунд против 20 секунд у Sora или потенциальных 140+ секунд у Veo со сцепкой) и, что особенно заметно на практике, связности сложных многообъектных сцен и физики движения. У модели также нет полноценной встроенной генерации синхронного звука и диалогов уровня Veo или Sora — это скорее инструмент для коротких визуальных зарисовок, чем для готового ролика со звуковой дорожкой.
При этом сильная сторона Kandinsky Video ровно там, где мировые лидеры слабее всего для российской аудитории: он работает без VPN, бесплатен в базовом использовании, понимает русскоязычные промпты без потери качества перевода и не создаёт вопросов с оплатой — авторизация идёт через привычные российские сервисы. Для быстрых экспериментов, коротких визуальных зарисовок для соцсетей или проверки идеи перед тем, как платить за более мощный зарубежный инструмент, это разумная стартовая точка. Других заметных российских разработок именно в генерации видео (в отличие от изображений) на момент публикации не обнаружено — ни у Яндекса, ни у VK пока нет собственной публично доступной модели такого назначения; вместо этого на рынке появились российские агрегаторы, которые не создают собственные модели, а дают доступ к зарубежным (Veo, Kling, Runway, Luma, Seedance и другим) через единый интерфейс с оплатой рублёвой картой — от условных 600-700 ₽ в месяц плюс наценка посредника.
| Модель | Макс. разрешение | Макс. длительность | Звук | Цена | Без VPN из РФ | Оплата картой РФ |
|---|---|---|---|---|---|---|
| Sora 2 / Sora 2 Pro OpenAI | 720p / 1080p | 20 сек, до 120 сек со сцепкой | Да, встроенный | $0.10-0.70/сек | Нет — сервис закрыт для потребителей с 26.04.2026 | Нет, нужна зарубежная карта |
| Veo 3.1 | До 4K | 4-8 сек, до ~140 сек со сцепкой | Да, встроенный | $0.10-0.75/сек по тарифу | Нет, нужен VPN | Нет напрямую, только через агрегаторы |
| Kling 3.0 Kuaishou | До 4K, 60 fps | 10 сек, до 3 мин со сцепкой | Да, с версии 3.0 | от $6.99/мес, кредитная система | Да, напрямую без VPN | Ограниченно — чаще через агрегаторы |
| Hailuo 02 / 2.3 MiniMax | 1080p | 6 или 10 сек | Ограниченно | от $0.28 за видео | Не проверено, вероятно нужен VPN | Нет напрямую |
| Runway Gen-4.5 Runway ML | До 4K (Turbo-пресет) | ~5-10 сек | Нет встроенной | $15-95/мес | Нет, нужен VPN | Нет напрямую |
| Pika Pika Labs | 1080p | ~5-10 сек | Ограниченно | $8-76/мес | Нет, нужен VPN | Нет напрямую |
| Luma Dream Machine Luma AI | 1080p | ~5 сек | Ограниченно | Есть бесплатный тариф + платные | Нет, нужен VPN | Нет напрямую |
| Kandinsky Video Сбер | HD 1280×720 | 5-10 сек | Нет полноценной | Бесплатно, с дневным лимитом | Да, российский сервис | Да, через GigaChat / Сбер ID |
Для рекламных креативов и коммерческих кампаний, где важны разрешение, контроль над камерой и повторяемость результата, разумнее ориентироваться на Veo 3.1 или Kling 3.0 в топовом тарифе — обе дают честное высокое разрешение и предсказуемую физику движения, а разница по факту сводится к доступности: Kling проще подключить из России, Veo даёт чуть более достоверную картинку и родной синхронный звук. Для крупных брендов, где бюджет не главное ограничение, а важнее контроль над результатом, стоит также присмотреться к Runway Gen-4.5 — он специализируется именно на управляемости камеры и композиции, а не на массовой генерации.
Для контента в соцсети — рилсы, шортсы, вирусные ролики — приоритет смещается на скорость и стоимость итерации, а не на максимальное разрешение: платформы сжимают видео при загрузке, и разница между 1080p и 4K зрителю в ленте часто незаметна. Здесь хорошо работают Kling на базовом тарифе, Hailuo 02 благодаря низкой цене за клип или Pika для быстрых черновиков и тестов нескольких вариантов одного ролика подряд.
Для личных и учебных проектов, где бюджет ограничен или отсутствует, логичная стартовая точка — Kandinsky Video: бесплатно, без VPN, без риска потратить деньги на эксперимент, который не понадобится. Если качества или длительности не хватает для конкретной задачи, следующий шаг — платный тариф Kling или Hailuo, а не сразу самый дорогой вариант рынка.
Для бизнеса, работающего с персональными данными клиентов в кадре — например, генерации на основе реальных фотографий людей — стоит отдельно проверить политику хранения и обучения на пользовательских данных у конкретного сервиса и убедиться, что используется коммерческий, а не бесплатный тариф: у части инструментов право на коммерческое использование результата привязано именно к платной подписке, а не к самому факту генерации.
Ниже — практический путь для читателя, который никогда не генерировал видео нейросетью и хочет попробовать без VPN, зарубежной карты и финансового риска. В качестве примера — Kandinsky Video, потому что это единственный из разобранных в статье инструментов, который решает сразу все три ограничения одновременно.
Если бесплатного лимита или качества Kandinsky Video для задачи не хватает, следующий логичный шаг — Kling AI: тот же принцип «без VPN», но с платной подпиской и заметно более высоким потолком по разрешению и длительности. Готовые формулировки для разных сценариев — в статье «Промпты для видео-сценариев», а если задача — не придумать сцену с нуля, а оживить конкретную фотографию, подробный разбор подхода есть в статье «Как создать видео из фото нейросетью».