FLUX 3 Video от Black Forest Labs: мультимодальная модель с аудио, видео и роботами
Black Forest Labs запустила FLUX 3 Video - единую архитектуру для генерации изображений, видео и аудио с нативным звуком. Модель заявляет о превосходстве над Seedance 2.0, Gemini Omni и Grok Imagine. Параллельно анонсирован FLUX3-mimic - роботизированная модель на базе FLUX 3, уже тестируемая с Audi.
Black Forest Labs наконец показала то, о чём намекала с самого запуска Flux 1 в 2024 году: видеомодель. Два года прошло с момента, когда на главной странице сайта BFL была подсказка про видео - и вот 24 июля 2026 это стало реальностью.
Что такое FLUX 3 Video
FLUX 3 - это не отдельный видеогенератор, прикрученный к существующей картиночной модели. BFL описывает её как единую мультимодальную архитектуру, охватывающую изображения, видео, аудио и предсказание действий. В основе лежит подход Self Flow, объединяющий все модальности под одним капотом.
Ключевое: все выходные данные включают нативную генерацию аудио. Это не постобработка, а часть архитектуры.
Конкретные возможности
Согласно официальному блогпосту BFL, модель умеет:
- Генерировать видео из изображения - либо продолжая с начального кадра («анимация»), либо используя изображение как визуальный референс.
- Делать video-to-video: переносить ключевые элементы исходного клипа (например, персонажа) в новую сцену или контекст.
- Продолжать видео и аудио из входного клипа с генеративным расширением.
- Работать с keyframe-to-video: управляемые переходы между заданными моментами.
- Поддерживать широкий диапазон визуальных стилей и соотношений сторон - от любительских камкордер-съёмок до анимации и киностилистики.
- Агентно соединять отдельные клипы в длинные многокадровые последовательности.
- Генерировать сильную типографику и анимированные дизайны.
Отдельно в источнике отмечается высокое разнообразие стилей - FLUX 3 Video обрабатывает диапазон от случайной камкордер-съёмки до кинематографики.
Сравнение с конкурентами
BFL заявляет, что FLUX 3 Video обходит Seedance 2.0, Gemini Omni и Grok Imagine. Часть возможностей модели пересекается с тем, что ранее считалось SOTA у других фронтирных лабораторий - в частности, то, что обсуждалось в контексте Grok Imagine. По словам авторов AINews, сообщество получило сигнал: эти фичи теперь воспроизведены независимо, возможно на уровне SOTA.
Дев-версия с открытыми весами анонсирована и находится в разработке.
FLUX3-mimic: когда видеомодель управляет роботами
Параллельно с основным релизом команда mimic robotics объявила о FLUX-mimic - модели Video-Action, построенной поверх FLUX 3.
Фишка в следующем: FLUX-mimic обучена на данных роботов и носимых устройств для общей моторики, и при этом разворачивается на одном локальном GPU. Центральный тезис команды - качество видео-мирового-моделирования напрямую переносится в качество управления роботом и повышает эффективность обучения.
Модель уже тестируется с Audi. Не прототип в лаборатории - реальные заводские условия.
Дополнительный контекст: GeneralistAI с моделью GEN-1 идёт похожим путём - поддержка разных типов манипуляторов и адаптация, когда «рука» меняется прямо во время выполнения задачи. Это подтверждает общий вектор: универсальные политики управления роботами через кондиционирование на морфологию, а не специализацию под каждый манипулятор.
Контекст: команда и история
BFL, по словам авторов источника, связывает FLUX 3 с более ранними исследованиями Self-Flow. Среди участников команды упоминаются @hila_chefer и @robrombach. Проект BFL подробно разбирался в подкасте Latent Space с Anjney Midha.
Лого BFL в лесу на старом сайте с намёком на видео в 2024 году - теперь выглядит как намеренный анонс с горизонтом в два года.
Что это значит
Если ты работаешь с генерацией контента, тебе стоит следить за FLUX 3 Video по двум причинам.
Во-первых, нативное аудио прямо в архитектуре - это другой класс задач, чем склейка видео + озвучка отдельными инструментами. Во-вторых, дев-версия с открытыми весами означает локальный запуск без API-зависимости и потенциально без подписки.
Для тех, кто работает в робототехнике или следит за этим направлением: FLUX-mimic на одном локальном GPU с уже реальными тестами на производстве - это конкретный сигнал, что видео-генерация и управление роботами сближаются быстрее, чем казалось год назад.
Источник: Latent Space / AINews, 24 июля 2026 - ссылка
FAQ
Когда будет открытая версия FLUX 3 Video? Дев-версия с открытыми весами анонсирована, конкретная дата в источнике не указана.
Как получить доступ сейчас? BFL открыла early access для FLUX 3 Video. Детали - на странице Black Forest Labs.
FLUX3-mimic - это отдельный продукт? Да, его разрабатывает команда mimic robotics поверх архитектуры FLUX 3. Тестируется с Audi в реальных условиях.