Hitech logo

Кейсы

ByteDance создает ИИ-модель для мгновенной генерации 3D-миров

TODO:
Екатерина ШемякинскаяСегодня, 01:39 PM

Основатель ByteDance Чжан Имин лично курирует разработку модели «пространственного интеллекта» для создания интерактивных 3D-миров в реальном времени. По данным Bloomberg, система на базе Seedance сможет генерировать 20 кадров в секунду с задержкой 0,05 секунды. Ее могут запустить уже в октябре 2026 года и использовать в XR-гарнитурах Pico, прямых трансляциях и видеоиграх. Вынося вычисления в облако, ByteDance рассчитывает снизить требования к оборудованию и усилить свои позиции в гонке за разработку моделей мира.

Самые интересные технологические и научные новости выходят в нашем телеграм-канале Хайтек+. Подпишитесь, чтобы быть в курсе.

Модель будет построена на основе Seedance — системы ByteDance для генерации видео, которая уже используется в экосистеме компании, включая продукты CapCut и Doubao. Она должна создавать интерактивные виртуальные миры, которые могут использоваться в прямых трансляциях, коротких сериалах и играх. В отличие от обычной генерации видео, такая система должна не просто создавать последовательность кадров, а поддерживать согласованную реакцию виртуального пространства на действия пользователя.

Система сможет генерировать около 20 кадров в секунду с задержкой 0,05 секунды. Обработка будет происходить в облаке, а не непосредственно на устройстве. Такой подход позволяет перенести основную вычислительную нагрузку с гарнитуры на дата-центры и потенциально сделать устройства для дополненной и виртуальной реальности дешевле и менее требовательными к вычислительным ресурсам.

Технология может быть особенно важна для Pico — подразделения ByteDance, выпускающего устройства виртуальной и дополненной реальности. Новая модель должна создавать виртуальные миры, реагирующие на голосовые команды и движения пользователей Pico.

Часть функций XR-устройств в таком случае можно будет перенести с самого оборудования в облако. Конкуренция в этой сфере будет зависеть не только от характеристик гарнитур, но и от качества моделей и доступных вычислительных ресурсов.

Разработка соответствует одному из приоритетов ByteDance в области искусственного интеллекта на 2026 год. По данным китайского издания 36Kr, компания поставила модели мира на первое место среди четырех направлений развития ИИ. На их обучение ByteDance, как сообщалось, выделила крупнейший среди своих ИИ-проектов бюджет на данные — сумму в юанях с восьмизначным числом, которая в 3-4 раза превышает расходы конкурентов.

ByteDance развивает два направления: модели «зрение–язык–действие» для робототехники и 3D-моделирование для игр и развлечений. Пространственная видеомодель относится ко второму. В начале 2026 года внутренние тесты показывали отставание от мирового уровня на 10%, но компания рассчитывала выпустить собственную модель мира до конца года. В августе ByteDance привлекла $30 млрд кредитного финансирования и рассматривает инвестиции до $70 млрд в ИИ-инфраструктуру.

В похожем направлении двигается стартап World Labs, основанный исследовательницей в области компьютерного зрения Фэй-Фэй Ли. В начале сентября компания представила Atlas — мультимодальную модель мира, которая умеет создавать и реконструировать трехмерные пространства по изображениям, а затем генерировать новые виды сцены с управляемой камерой. Разработка отражает сдвиг в сфере ИИ от моделей, работающих преимущественно с текстом и изображениями, к системам, которые учатся представлять пространство, его геометрию и изменения во времени. World Labs называет это направлением «пространственного интеллекта» (spatial intelligence) и связывает его перспективы не только с созданием контента и играми, но и с моделированием и обучением роботов.