Kandinsky WM 1.0: Сбер открыл модели мира для Physical AI
Сбер опубликовал Kandinsky WM 1.0 — набор из трёх специализированных видеомоделей для Physical AI: автомобильные сценарии, робототехника, сцены со сложной физикой. Код и веса доступны на GitHub, GitVerse и HuggingFace под лицензией MIT. Модели работают в режиме image-to-video: первый кадр плюс текстовый промпт на входе.
Сбер выложил в открытый доступ Kandinsky WM 1.0 - набор из трёх специализированных видеомоделей под лицензией MIT. Код и веса доступны на GitHub, GitVerse и HuggingFace.
Что такое Kandinsky WM 1.0
WM расшифровывается как World Model - «модель мира». Kandinsky WM 1.0 включает три отдельные модели, заточенные под конкретные домены Physical AI:
- автомобильные сценарии
- робототехника
- сцены со сложной физикой
Все три работают в режиме image-to-video (I2V): на входе - первый кадр сцены и подробный текстовый промпт на английском, на выходе - визуальное продолжение сцены.
Причём тут «модель мира» и как это классифицировать
Термин «модель мира» используется широко, поэтому команда Сбера уточняет свою позицию через классификацию Фэй-Фэй Ли (инициатор проекта ImageNet, World Labs). По этой схеме модели мира делятся по функции:
- renderer - отвечает за наблюдение, строит видеокадры
- simulator - моделирует состояние и динамику мира
- planner - выбирает следующее действие
Kandinsky WM 1.0 по этой классификации - renderer. Модель строит визуальное продолжение сцены, но не управляет действиями агента. Сочетание всех трёх функций в одной системе - это то, к чему стремятся исследователи Physical AI, называя это foundation world model.
Зачем вообще нужны такие модели
Physical AI - системы, которые воспринимают физический мир и действуют в нём: роботы, автономные автомобили, промышленное оборудование. Для их обучения нужны видеоданные с достоверной геометрией, динамикой и физикой. Особенно - редкие и опасные сценарии.
Проблема в объёме. Если автомобиль будет непрерывно записывать данные весь год, он соберёт менее 10 000 часов уникальных дорожных сцен. Для сравнения: NVIDIA обучала Cosmos на 20 млн часов видео, Meta обучала V-JEPA 2 на более чем 1 млн часов интернет-видео.
При этом большая часть собранных данных - банальная езда по прямой и остановки на светофорах. Редкие ситуации (внезапные перестроения, непредсказуемые пешеходы, экстремальная погода, ДТП) критически важны для безопасности, но их почти нет в реальной выборке. Это проблема длинного хвоста (long tail).
В робототехнике та же история: каждый эпизод требует реального робота, оператора, контролируемого окружения и ручной валидации. Менять объекты, освещение, конфигурацию сцены - дорого и трудоёмко.
Почему обычные видеомодели не решают задачу
Синтетические данные могут закрыть пробелы в реальных - но только если модель физически достоверна. Современные видеомодели пока генерируют убедительную картинку, но ошибаются в физике.
Авторы показывают конкретный пример: несколько моделей получают первый кадр и промпт про падение теннисного мяча и блока с манипуляторов на подушки. Модели отрисовывают разжатие захватов, падение объектов, деформацию подушек и тени - но неправильно, потому что не понимают физику процесса.
При этом решить проблему физичности только на этапе Post-Train не получается: улучшение на одних примерах даёт деградацию на других. Нужно сначала дообучить модель под конкретный домен, и только потом применять специфические Post-Train подходы. Это снижает обобщающую способность, зато даёт высокое качество в нужном домене.
Контекст: откуда растёт Kandinsky WM 1.0
В конце 2024 года Сбер представил семейство Kandinsky 5.0. Флагманная Kandinsky 5.0 Video Pro заняла первое место среди open-source-моделей в категории text-to-video на arena.ai и долгое время его удерживала.
Kandinsky WM 1.0 - отдельное ответвление: не универсальная видеогенерация, а три узкоспециализированные модели для конкретных задач Physical AI.
Что это значит
Если ты занимаешься разработкой в области автономных систем или робототехники - это конкретный инструмент для расширения обучающих датасетов синтетическими данными. MIT-лицензия означает, что модели можно использовать в коммерческих проектах без ограничений.
Для исследователей это также готовые веса, с которыми можно работать сразу: GitHub, GitVerse, HuggingFace.
Полная статья с деталями архитектуры, сборки данных и обучения - на Habr, 4 августа.