Модель будет построена на основе Seedance — системы ByteDance для генерации видео, которая уже используется в экосистеме компании, включая продукты CapCut и Doubao. Она должна создавать интерактивные виртуальные миры, которые могут использоваться в прямых трансляциях, коротких сериалах и играх. В отличие от обычной генерации видео, такая система должна не просто создавать последовательность кадров, а поддерживать согласованную реакцию виртуального пространства на действия пользователя.
Система сможет генерировать около 20 кадров в секунду с задержкой 0,05 секунды. Обработка будет происходить в облаке, а не непосредственно на устройстве. Такой подход позволяет перенести основную вычислительную нагрузку с гарнитуры на дата-центры и потенциально сделать устройства для дополненной и виртуальной реальности дешевле и менее требовательными к вычислительным ресурсам.
Технология может быть особенно важна для Pico — подразделения ByteDance, выпускающего устройства виртуальной и дополненной реальности. Новая модель должна создавать виртуальные миры, реагирующие на голосовые команды и движения пользователей Pico.
Часть функций XR-устройств в таком случае можно будет перенести с самого оборудования в облако. Конкуренция в этой сфере будет зависеть не только от характеристик гарнитур, но и от качества моделей и доступных вычислительных ресурсов.
Разработка соответствует одному из приоритетов ByteDance в области искусственного интеллекта на 2026 год. По данным китайского издания 36Kr, компания поставила модели мира на первое место среди четырех направлений развития ИИ. На их обучение ByteDance, как сообщалось, выделила крупнейший среди своих ИИ-проектов бюджет на данные — сумму в юанях с восьмизначным числом, которая в 3-4 раза превышает расходы конкурентов.
ByteDance развивает два направления: модели «зрение–язык–действие» для робототехники и 3D-моделирование для игр и развлечений. Пространственная видеомодель относится ко второму. В начале 2026 года внутренние тесты показывали отставание от мирового уровня на 10%, но компания рассчитывала выпустить собственную модель мира до конца года. В августе ByteDance привлекла $30 млрд кредитного финансирования и рассматривает инвестиции до $70 млрд в ИИ-инфраструктуру.
В похожем направлении двигается стартап World Labs, основанный исследовательницей в области компьютерного зрения Фэй-Фэй Ли. В начале сентября компания представила Atlas — мультимодальную модель мира, которая умеет создавать и реконструировать трехмерные пространства по изображениям, а затем генерировать новые виды сцены с управляемой камерой. Разработка отражает сдвиг в сфере ИИ от моделей, работающих преимущественно с текстом и изображениями, к системам, которые учатся представлять пространство, его геометрию и изменения во времени. World Labs называет это направлением «пространственного интеллекта» (spatial intelligence) и связывает его перспективы не только с созданием контента и играми, но и с моделированием и обучением роботов.

