- World Labs анонсировала мультимодальную ИИ-модель Atlas для создания 3D-миров по фото.
- Atlas объединяет текст, фото, видео и 3D-данные для генерации детализированных сцен и видео.
- Модель может реконструировать реальные помещения, генерировать интерактивные симуляции и моделировать движение камеры.
- Atlas позиционируется как основа для развития «пространственного интеллекта».
- Модель может получать от одного до шести изображений и заданной траектории камеры для создания видео продолжительностью до 1 минуты.
- Atlas также может реконструировать реальные пространства по небольшому числу фотографий, создавая новые виды сцены, карты глубины и облака точек.
- Atlas может восстанавливать трехмерную сцену по видеозаписи и создавать кадры с новых ракурсов.
- Atlas используется для моделирования движения и взаимодействия объектов в робототехнике.
- Atlas представляет собой мультимодальный авторегрессионный диффузионный трансформер, объединяющий разные типы данных в одном контексте.
- Atlas протестирована на генерации видео с заданной траекторией камеры и 3D-реконструкции по нескольким изображениям, где она показала преимущества перед другими моделями.
Главное отличие Atlas от обычных видеогенераторов — пространственная привязка данных: изображения, глубина и положение камеры рассматриваются как части единой трехмерной сцены.