Hitech logo

Кейсы

World Labs анонсировала Atlas — ИИ-модель, способную строить 3D-миры по фото

TODO:
Екатерина ШемякинскаяСегодня, 03:12 PM

Стартап World Labs, основанный «крестной матерью ИИ» Фей-Фей Ли, представил мультимодальную модель мира Atlas. Система, объединяющая текст, фото, видео и 3D-данные, позволяет генерировать детализированные трехмерные сцены и кинематографичные видео в разрешении 1440p. Atlas умеет реконструировать реальные помещения по нескольким снимкам со смартфона, генерировать интерактивные симуляции для обучения роботов и моделировать движение камеры с любых ракурсов. Модель позиционируют как основу для развития «пространственного интеллекта».

Самые интересные технологические и научные новости выходят в нашем телеграм-канале Хайтек+. Подпишитесь, чтобы быть в курсе.

Atlas может получить от одного до шести исходных изображений и заданную траекторию движения камеры, после чего создать видео продолжительностью до одной минуты в разрешении 1440p. При этом камера может двигаться под заданными углами и по выбранной траектории, а модель достраивает части сцены, которых не было видно на исходных кадрах.

Модель также умеет реконструировать реальные пространства по небольшому числу фотографий. Обычно для этого достаточно 2-3 изображений, хотя Atlas может работать и с десятками или даже более чем сотней снимков. На выходе она создает новые виды сцены, карты глубины, облака точек и 3D Gaussian Splats — представление трехмерной сцены в виде множества небольших «облаков» в пространстве.

Еще одно направление — работа с видео как с моделью пространства и времени. Atlas может восстанавливать трехмерную сцену по обычной видеозаписи, а затем создавать кадры с новых ракурсов, в том числе с тех, которых не было в исходном видео. Это позволяет, например, получить эффект «буллет-тайм», когда одно событие можно рассматривать с разных точек, перемещая виртуальную камеру. Для демонстраций World Labs использовала смартфоны и экшн-камеры, а не специальное оборудование для объемной съемки.

Робототехника — один из приоритетов компании. Atlas может не только восстановить трехмерную среду, но и смоделировать, что увидят сенсоры робота при движении по заданному маршруту.

Модель генерирует изображения и карты глубины с точки зрения установленных на роботе камер. Кроме того, Atlas способна моделировать движение и взаимодействие объектов — можно менять их положение, освещение и другие параметры. Такой подход World Labs называет Real-to-Sim — переносом данных из реального мира в симуляцию для создания обучающих и тестовых сред для роботов.

Технически Atlas представляет собой мультимодальный авторегрессионный диффузионный трансформер. Проще говоря, модель объединяет разные типы данных в одном контексте и последовательно генерирует следующие элементы, одновременно используя механизмы, характерные для языковых и генеративных моделей изображений и видео.

Главное отличие Atlas от обычных видеогенераторов — пространственная привязка данных: изображения, глубина и положение камеры рассматриваются как части единой трехмерной сцены.

World Labs протестировала Atlas на двух задачах: генерации видео с заданной траекторией камеры и 3D-реконструкции по нескольким изображениям. В первом тесте сторонние оценщики сравнивали Atlas с современными видеомоделями и чаще выбирали ее результат: преимущество составило от 75% до 94% в зависимости от модели. Во втором Atlas сравнили со специализированными открытыми моделями по точности 3D-реконструкции и заявили о меньшей средней ошибке. При этом результаты опубликованы самой World Labs и пока не получили независимого подтверждения. Atlas уже предоставляется в рамках раннего доступа отдельным партнерам и в будущем станет основой новых версий Marble — продукта компании для создания целых 3D-миров.