«Сбер» открыл Kandinsky WM 1.0
«Сбер» выложил в открытый доступ Kandinsky WM 1.0 — семейство нейросетей класса «модель мира». Их задача генерировать физически достоверное видео, на котором можно обучать роботов, беспилотные автомобили и промышленное оборудование.
Видео, которое понимает физику
Модель получает первый кадр и текстовое описание сцены, а на выходе достраивает пятиисекундное продолжение, где предметы движутся, сталкиваются и деформируются в соответствии с законами реального мира.
В семействе три специализированные модели:
K5-AV генерирует дорожные сцены для беспилотного транспорта;
K5-RO - сцены с роботами-манипуляторами;
K5-PH - сложные физические взаимодействия, например течение жидкостей и деформацию объектов.
Все три построены на базе Kandinsky 5.0 Video Lite на 2 млрд параметров и дообучены на миллионах роликов с камер роботов, беспилотников и производственных процессов.
Синтетические данные вместо опасных экспериментов
Для систем Physical AI нужны огромные объёмы видео реальных ситуаций. Но собрать такие данные в реальном мире сложно, дорого, а иногда и небезопасно.
Синтетическое видео позволяет решить эту проблему. Редкую или опасную ситуацию, например аварию, можно просто сгенерировать с нужными объектами, действиями и погодными условиями.
Результаты на уровне крупных конкурентов
По данным команды, несмотря на сравнительно небольшой размер, Kandinsky WM 1.0 вошла в топ-10 на трёх рассмотренных бенчмарках: заняла 4-е место на PAI-Bench-G, 5-е на Physics-IQ Verified и 6-е на RBench. В качестве основного конкурента разработчики рассматривали NVIDIA Cosmos-Predict2.5 того же размера.
Модели уже используют для обучения роботов
Разработка уже применяется на практике: Центр робототехники «Сбера» обучает на синтетических данных роботов, а институт AIRI генерирует дорожные сценарии для симуляторов беспилотного транспорта.
Код и веса моделей открыты под лицензией MIT — использовать их можно бесплатно, в том числе в коммерческих проектах.
Сами авторы называют этот релиз первым шагом к полноценным моделям мира — нейросетям, которые не просто генерируют видео, а способны прогнозировать развитие событий.