Atlas может получить от одного до шести исходных изображений и заданную траекторию движения камеры, после чего создать видео продолжительностью до одной минуты в разрешении 1440p. При этом камера может двигаться под заданными углами и по выбранной траектории, а модель достраивает части сцены, которых не было видно на исходных кадрах.
Модель также умеет реконструировать реальные пространства по небольшому числу фотографий. Обычно для этого достаточно 2-3 изображений, хотя Atlas может работать и с десятками или даже более чем сотней снимков. На выходе она создает новые виды сцены, карты глубины, облака точек и 3D Gaussian Splats — представление трехмерной сцены в виде множества небольших «облаков» в пространстве.
Еще одно направление — работа с видео как с моделью пространства и времени. Atlas может восстанавливать трехмерную сцену по обычной видеозаписи, а затем создавать кадры с новых ракурсов, в том числе с тех, которых не было в исходном видео. Это позволяет, например, получить эффект «буллет-тайм», когда одно событие можно рассматривать с разных точек, перемещая виртуальную камеру. Для демонстраций World Labs использовала смартфоны и экшн-камеры, а не специальное оборудование для объемной съемки.
Робототехника — один из приоритетов компании. Atlas может не только восстановить трехмерную среду, но и смоделировать, что увидят сенсоры робота при движении по заданному маршруту.
Модель генерирует изображения и карты глубины с точки зрения установленных на роботе камер. Кроме того, Atlas способна моделировать движение и взаимодействие объектов — можно менять их положение, освещение и другие параметры. Такой подход World Labs называет Real-to-Sim — переносом данных из реального мира в симуляцию для создания обучающих и тестовых сред для роботов.
Технически Atlas представляет собой мультимодальный авторегрессионный диффузионный трансформер. Проще говоря, модель объединяет разные типы данных в одном контексте и последовательно генерирует следующие элементы, одновременно используя механизмы, характерные для языковых и генеративных моделей изображений и видео.
Главное отличие Atlas от обычных видеогенераторов — пространственная привязка данных: изображения, глубина и положение камеры рассматриваются как части единой трехмерной сцены.
World Labs протестировала Atlas на двух задачах: генерации видео с заданной траекторией камеры и 3D-реконструкции по нескольким изображениям. В первом тесте сторонние оценщики сравнивали Atlas с современными видеомоделями и чаще выбирали ее результат: преимущество составило от 75% до 94% в зависимости от модели. Во втором Atlas сравнили со специализированными открытыми моделями по точности 3D-реконструкции и заявили о меньшей средней ошибке. При этом результаты опубликованы самой World Labs и пока не получили независимого подтверждения. Atlas уже предоставляется в рамках раннего доступа отдельным партнерам и в будущем станет основой новых версий Marble — продукта компании для создания целых 3D-миров.

