FLUX 3 от Black Forest Labs: видео со звуком, картинки и роботы в одной модели | AI Радар
Продукт

Black Forest Labs выпустила FLUX 3 — первую модель, которая генерирует видео со звуком, картинки и управляет роботами

📅 25 июля 2026 ✍️ Александр Григорьев 🏷 Black Forest Labs · Генеративный ИИ · Видео
Black Forest Labs 23 июля представила FLUX 3 — мультимодальную модель, обученную одновременно на изображениях, видео и звуке. Ролики длиной до 20 секунд с нативным аудио в тестах компании предпочли Runway Gen 4.5 в 77% сравнений и Kling v3 Pro в 60%; видео-модуль уже адаптируют для роботов — Audi использует его для сборки гибких уплотнителей дверей.
20 сек
Видео с нативным
звуком за раз
77%
Побед над
Runway Gen 4.5
93%
Побед над
Luma Ray 3.2

Что умеет FLUX 3

Немецкая Black Forest Labs, основанная бывшими разработчиками Stable Diffusion, 23 июля представила FLUX 3 — свою первую публичную модель для генерации видео и одновременно самое масштабное обновление всей линейки FLUX. В отличие от большинства конкурентов, которые обучают отдельные модели под изображения, видео и звук, FLUX 3 построена как единая архитектура: она учится понимать пространственную структуру, движение, звук и физическое взаимодействие объектов в рамках одного процесса обучения, который компания называет Self Flow.

Практический результат — ролики длиной до 20 секунд с нативно сгенерированным звуком: диалогами на разных языках, шумами среды, музыкой. Модель поддерживает продолжение видео, переходы между ключевыми кадрами и склейку нескольких клипов в более длинную последовательность. В собственных тестах Black Forest Labs FLUX 3 обошла Grok Imagine Video в 69% сравнений, Kling v3 Pro — в 60%, Runway Gen 4.5 — в 77%, а Luma Ray 3.2 — в 93% случаев.

От рекламных роликов до промышленных роботов

Отдельное направление релиза — робототехника. Видео-модуль FLUX 3 адаптируют под предсказание физических действий в рамках проекта FLUX mimic, разработанного вместе с компанией mimic robotics. Один из первых партнёров — концерн Audi, который использует систему для задач мягкой манипуляции: например, установки гибких дверных уплотнителей — операции, которую традиционная автоматизация выполняет плохо. Это подтверждает более широкий тренд 2026 года: генеративные видео-модели всё чаще становятся не инструментом контента, а способом обучать роботов физическому миру.

Пока в открытом доступе — только API для видео и робо-функций через ограниченный круг партнёров; полноценная генерация изображений появится в ближайшие недели, а открытая версия «Dev» для локального запуска ожидается позже в 2026 году. Это значит, что массовый доступ к возможностям FLUX 3 растянется на месяцы.

Что это значит для российского рынка креатива

Для российских маркетологов, продюсеров и агентств релиз важен по двум причинам. Во-первых, FLUX 3 поднимает планку качества генеративного видео сразу на несколько уровней — до сих пор в связке «изображение плюс звук за один проход» на таком уровне не работал ни один массовый инструмент, включая российские Kandinsky и Шедеврум, которые пока специализируются на статичных изображениях и коротких немых клипах. Во-вторых, модель напрямую конкурирует с сервисами, которые уже используют российские команды в обход санкционных ограничений, — Runway, Kling, Luma, — и обещает вытеснить часть из них качеством и ценой.

Формально Black Forest Labs, как и большинство западных AI-компаний, не имеет представительства в России, а официальная оплата с российских карт по-прежнему не проходит. Доступ для локальных студий и агентств почти наверняка пойдёт через тот же канал, что и для Midjourney или Runway, — зарубежные счета, посредники, VPN. Для видеопродакшена и рекламных агентств это означает рост косвенных издержек на доступ к технологии, которая объективно ускоряет производство роликов: то, что раньше требовало съёмочной группы и монтажа, FLUX 3 в перспективе сможет собрать по текстовому описанию за минуты.

Долгосрочно интереснее вторая часть релиза — применение в робототехнике. Если подход Black Forest Labs и mimic robotics подтвердит эффективность на промышленных задачах, это станет ещё одним сигналом того, что генеративные видео-модели становятся инфраструктурой физического ИИ — направления, которое Сбер также называет одним из приоритетных для собственной робототехники.

Что изменится в продакшене рекламных роликов

Для агентств ключевой вопрос — не сам факт появления новой модели, а то, сколько этапов производства она реально закрывает. До сих пор типичный пайплайн генеративного видео состоял из нескольких отдельных инструментов: одна модель рисовала кадры, другая анимировала движение, третья — отдельно накладывала звук и голос, а склейку и монтаж всё равно делали вручную. FLUX 3 объединяет три этих шага в один проход, что на практике означает не просто ускорение, а изменение самой структуры команды: часть работы, которая раньше требовала звукорежиссёра и моушн-дизайнера, теперь можно закрыть одним промптом. Для небольших продакшенов и фрилансеров это шанс конкурировать с крупными студиями по скорости; для агентств — стимул пересобирать внутренние процессы вокруг генеративных инструментов быстрее, чем это делают конкуренты.

📎 Первоисточник: VentureBeat · Июль 2026 ↗