Сбер открыл нейросеть Kandinsky WM 1.0 для создания видео, обучающих роботов
Сбер представил семейство генеративных моделей Kandinsky WM 1.0, которые создают короткие видеоролики с точным соблюдением законов физики. Эти видео предназначены для обучения систем Physical AI — роботов, беспилотного транспорта и промышленного оборудования. Код и веса моделей уже опубликованы под открытой лицензией MIT и доступны разработчикам бесплатно.
Новые модели решают проблему дефицита обучающих данных для систем искусственного интеллекта, взаимодействующих с физическим миром. Сбор реальных видеозаписей для таких целей — дорогой и трудоемкий процесс, а некоторые сценарии, например аварии или экстремальные погодные условия, невозможно зафиксировать в реальности. Kandinsky WM позволяет генерировать подобные редкие и опасные ситуации, которые невозможно снять в реальных условиях.
В основе Kandinsky WM 1.0 лежит нейросеть Kandinsky 5.0 Video Lite, дообученная на нескольких миллионах видеозаписей с камер роботов, беспилотных автомобилей и промышленных объектов. Разработчики уделили особое внимание физической достоверности: объекты не деформируются, не исчезают и двигаются естественно. Для улучшения автомобильных сцен применялось обучение с подкреплением, где Kandinsky WM генерировали ролики, а другие нейросети оценивали их качество.
Модели создают видео длительностью около пяти секунд, демонстрирующие отдельные действия: манипуляции с предметами, дорожные маневры, этапы производственных процессов. Эти ролики уже используются Центром робототехники Сбера для обучения собственных роботов, а также институтом AIRI в дорожном симуляторе. По словам разработчиков, Kandinsky WM — первый шаг к созданию полноценных моделей мира, способных моделировать развитие сцены во времени и служить симуляторами для обучения роботов.