VCLVibe Coding LabИИ в работе — без VPN
Подписаться
НейросетиНовостиСтатус нейросетейДоступ из РФ
РАЗДЕЛЫ
ТуториалыАвтоматизацииИнструментыВайбкодинг
БИБЛИОТЕКИ
ПромптыШаблоныMCP-серверыГлоссарийПодписаться в Telegram
ГлавнаяНовостиKandinsky WM 1.0: Сбер открыл модели мира для Physical AI
НовостьРелизkandinsky

Kandinsky WM 1.0: Сбер открыл модели мира для Physical AI

VCL
Редакция
Vibe Coding Lab
4 августа 2026обновлено 04.08
3 мин чтения
КОРОТКО

Сбер опубликовал Kandinsky WM 1.0 — набор из трёх специализированных видеомоделей для Physical AI: автомобильные сценарии, робототехника, сцены со сложной физикой. Код и веса доступны на GitHub, GitVerse и HuggingFace под лицензией MIT. Модели работают в режиме image-to-video: первый кадр плюс текстовый промпт на входе.

Сбер выложил в открытый доступ Kandinsky WM 1.0 - набор из трёх специализированных видеомоделей под лицензией MIT. Код и веса доступны на GitHub, GitVerse и HuggingFace.

Что такое Kandinsky WM 1.0

WM расшифровывается как World Model - «модель мира». Kandinsky WM 1.0 включает три отдельные модели, заточенные под конкретные домены Physical AI:

  • автомобильные сценарии
  • робототехника
  • сцены со сложной физикой

Все три работают в режиме image-to-video (I2V): на входе - первый кадр сцены и подробный текстовый промпт на английском, на выходе - визуальное продолжение сцены.

Причём тут «модель мира» и как это классифицировать

Термин «модель мира» используется широко, поэтому команда Сбера уточняет свою позицию через классификацию Фэй-Фэй Ли (инициатор проекта ImageNet, World Labs). По этой схеме модели мира делятся по функции:

  • renderer - отвечает за наблюдение, строит видеокадры
  • simulator - моделирует состояние и динамику мира
  • planner - выбирает следующее действие

Kandinsky WM 1.0 по этой классификации - renderer. Модель строит визуальное продолжение сцены, но не управляет действиями агента. Сочетание всех трёх функций в одной системе - это то, к чему стремятся исследователи Physical AI, называя это foundation world model.

Зачем вообще нужны такие модели

Physical AI - системы, которые воспринимают физический мир и действуют в нём: роботы, автономные автомобили, промышленное оборудование. Для их обучения нужны видеоданные с достоверной геометрией, динамикой и физикой. Особенно - редкие и опасные сценарии.

Проблема в объёме. Если автомобиль будет непрерывно записывать данные весь год, он соберёт менее 10 000 часов уникальных дорожных сцен. Для сравнения: NVIDIA обучала Cosmos на 20 млн часов видео, Meta обучала V-JEPA 2 на более чем 1 млн часов интернет-видео.

При этом большая часть собранных данных - банальная езда по прямой и остановки на светофорах. Редкие ситуации (внезапные перестроения, непредсказуемые пешеходы, экстремальная погода, ДТП) критически важны для безопасности, но их почти нет в реальной выборке. Это проблема длинного хвоста (long tail).

В робототехнике та же история: каждый эпизод требует реального робота, оператора, контролируемого окружения и ручной валидации. Менять объекты, освещение, конфигурацию сцены - дорого и трудоёмко.

Почему обычные видеомодели не решают задачу

Синтетические данные могут закрыть пробелы в реальных - но только если модель физически достоверна. Современные видеомодели пока генерируют убедительную картинку, но ошибаются в физике.

Авторы показывают конкретный пример: несколько моделей получают первый кадр и промпт про падение теннисного мяча и блока с манипуляторов на подушки. Модели отрисовывают разжатие захватов, падение объектов, деформацию подушек и тени - но неправильно, потому что не понимают физику процесса.

При этом решить проблему физичности только на этапе Post-Train не получается: улучшение на одних примерах даёт деградацию на других. Нужно сначала дообучить модель под конкретный домен, и только потом применять специфические Post-Train подходы. Это снижает обобщающую способность, зато даёт высокое качество в нужном домене.

Контекст: откуда растёт Kandinsky WM 1.0

В конце 2024 года Сбер представил семейство Kandinsky 5.0. Флагманная Kandinsky 5.0 Video Pro заняла первое место среди open-source-моделей в категории text-to-video на arena.ai и долгое время его удерживала.

Kandinsky WM 1.0 - отдельное ответвление: не универсальная видеогенерация, а три узкоспециализированные модели для конкретных задач Physical AI.

Что это значит

Если ты занимаешься разработкой в области автономных систем или робототехники - это конкретный инструмент для расширения обучающих датасетов синтетическими данными. MIT-лицензия означает, что модели можно использовать в коммерческих проектах без ограничений.

Для исследователей это также готовые веса, с которыми можно работать сразу: GitHub, GitVerse, HuggingFace.

Полная статья с деталями архитектуры, сборки данных и обучения - на Habr, 4 августа.

Habr · 4 августа
Свежие новости — в Telegram
Главное за день — коротко, без воды.
Подписаться