VCLVibe Coding LabИИ в работе — без VPN
Подписаться
НейросетиНовостиСтатус нейросетейДоступ из РФ
РАЗДЕЛЫ
ТуториалыАвтоматизацииИнструментыВайбкодинг
БИБЛИОТЕКИ
ПромптыШаблоныMCP-серверыГлоссарийПодписаться в Telegram
ГлавнаяНовостиFLUX 3 Video от Black Forest Labs: мультимодальная модель с аудио, видео и роботами
НовостьРелизflux

FLUX 3 Video от Black Forest Labs: мультимодальная модель с аудио, видео и роботами

VCL
Редакция
Vibe Coding Lab
24 июля 2026обновлено 24.07
3 мин чтения
КОРОТКО

Black Forest Labs запустила FLUX 3 Video - единую архитектуру для генерации изображений, видео и аудио с нативным звуком. Модель заявляет о превосходстве над Seedance 2.0, Gemini Omni и Grok Imagine. Параллельно анонсирован FLUX3-mimic - роботизированная модель на базе FLUX 3, уже тестируемая с Audi.

Black Forest Labs наконец показала то, о чём намекала с самого запуска Flux 1 в 2024 году: видеомодель. Два года прошло с момента, когда на главной странице сайта BFL была подсказка про видео - и вот 24 июля 2026 это стало реальностью.

Что такое FLUX 3 Video

FLUX 3 - это не отдельный видеогенератор, прикрученный к существующей картиночной модели. BFL описывает её как единую мультимодальную архитектуру, охватывающую изображения, видео, аудио и предсказание действий. В основе лежит подход Self Flow, объединяющий все модальности под одним капотом.

Ключевое: все выходные данные включают нативную генерацию аудио. Это не постобработка, а часть архитектуры.

Конкретные возможности

Согласно официальному блогпосту BFL, модель умеет:

  • Генерировать видео из изображения - либо продолжая с начального кадра («анимация»), либо используя изображение как визуальный референс.
  • Делать video-to-video: переносить ключевые элементы исходного клипа (например, персонажа) в новую сцену или контекст.
  • Продолжать видео и аудио из входного клипа с генеративным расширением.
  • Работать с keyframe-to-video: управляемые переходы между заданными моментами.
  • Поддерживать широкий диапазон визуальных стилей и соотношений сторон - от любительских камкордер-съёмок до анимации и киностилистики.
  • Агентно соединять отдельные клипы в длинные многокадровые последовательности.
  • Генерировать сильную типографику и анимированные дизайны.

Отдельно в источнике отмечается высокое разнообразие стилей - FLUX 3 Video обрабатывает диапазон от случайной камкордер-съёмки до кинематографики.

Сравнение с конкурентами

BFL заявляет, что FLUX 3 Video обходит Seedance 2.0, Gemini Omni и Grok Imagine. Часть возможностей модели пересекается с тем, что ранее считалось SOTA у других фронтирных лабораторий - в частности, то, что обсуждалось в контексте Grok Imagine. По словам авторов AINews, сообщество получило сигнал: эти фичи теперь воспроизведены независимо, возможно на уровне SOTA.

Дев-версия с открытыми весами анонсирована и находится в разработке.

FLUX3-mimic: когда видеомодель управляет роботами

Параллельно с основным релизом команда mimic robotics объявила о FLUX-mimic - модели Video-Action, построенной поверх FLUX 3.

Фишка в следующем: FLUX-mimic обучена на данных роботов и носимых устройств для общей моторики, и при этом разворачивается на одном локальном GPU. Центральный тезис команды - качество видео-мирового-моделирования напрямую переносится в качество управления роботом и повышает эффективность обучения.

Модель уже тестируется с Audi. Не прототип в лаборатории - реальные заводские условия.

Дополнительный контекст: GeneralistAI с моделью GEN-1 идёт похожим путём - поддержка разных типов манипуляторов и адаптация, когда «рука» меняется прямо во время выполнения задачи. Это подтверждает общий вектор: универсальные политики управления роботами через кондиционирование на морфологию, а не специализацию под каждый манипулятор.

Контекст: команда и история

BFL, по словам авторов источника, связывает FLUX 3 с более ранними исследованиями Self-Flow. Среди участников команды упоминаются @hila_chefer и @robrombach. Проект BFL подробно разбирался в подкасте Latent Space с Anjney Midha.

Лого BFL в лесу на старом сайте с намёком на видео в 2024 году - теперь выглядит как намеренный анонс с горизонтом в два года.

Что это значит

Если ты работаешь с генерацией контента, тебе стоит следить за FLUX 3 Video по двум причинам.

Во-первых, нативное аудио прямо в архитектуре - это другой класс задач, чем склейка видео + озвучка отдельными инструментами. Во-вторых, дев-версия с открытыми весами означает локальный запуск без API-зависимости и потенциально без подписки.

Для тех, кто работает в робототехнике или следит за этим направлением: FLUX-mimic на одном локальном GPU с уже реальными тестами на производстве - это конкретный сигнал, что видео-генерация и управление роботами сближаются быстрее, чем казалось год назад.


Источник: Latent Space / AINews, 24 июля 2026 - ссылка

FAQ

Когда будет открытая версия FLUX 3 Video? Дев-версия с открытыми весами анонсирована, конкретная дата в источнике не указана.

Как получить доступ сейчас? BFL открыла early access для FLUX 3 Video. Детали - на странице Black Forest Labs.

FLUX3-mimic - это отдельный продукт? Да, его разрабатывает команда mimic robotics поверх архитектуры FLUX 3. Тестируется с Audi в реальных условиях.

Latent · 24 июля
Свежие новости — в Telegram
Главное за день — коротко, без воды.
Подписаться