← 返回AI工具

World Labs Atlas 空间智能世界模型

李飞飞联合创办的 World Labs 于 2026 年 9 月 1 日发布,官方称其为从零预训练的 omni 世界模型,原生处理文本、图像、视频与 3D

工具概览

功能、使用步骤与常见问题见下方

功能特点

  • ✓ 相机可控生成:从一至多张参考图生成任意相机位置与角度的图像 / 视频,官方称可输出最长 1 分钟、1440p 的视频,并支持像素级精确的相机控制
  • ✓ 空间重建:从 1 到几十张输入图重建真实场景,官方称通常只用 2 到 3 张即可得到忠实重建,并超越专门训练的三维重建模型
  • ✓ 时空模拟:可从少量相机视频重构并重新取景(bullet time),用于 VFX,以及机器人 Real-to-Sim 的导航与操作仿真
  • ✓ 显式 3D 输出:原生同时处理 2D 图像帧与 3D 深度图,可输出点云或 3D Gaussian splats,与 Marble 采用同一表示
  • ✓ 文本生图:可由文本生成图像与 360 全景图,官方称能跟随复杂提示、渲染文字并生成多种视觉风格

使用步骤

  1. 在 World Labs 官方页面提交早期访问(early access)申请
  2. 准备 1 至 6 张参考图(重建场景可更多)或少量手机拍摄的视频作为输入
  3. 指定相机路径或位置,让 Atlas 生成新视角图像 / 视频,或进行稀疏视图三维重建
  4. 需要显式几何时导出点云 / 3D Gaussian splats,接入机器人或设计工作流

常见问题

Atlas 是什么?

World Labs 于 2026 年 9 月 1 日发布的下一代世界模型,官方称其为从零预训练的 omni 模型,原生处理文本、图像、视频与 3D。

它和普通视频生成模型有什么不同?

官方称 Atlas 支持像素级精确的相机控制,可从单张输入图生成任意角度的视图并保持三维一致,而不是只按提示词生成视频。

能生成多长、多清晰的视频?

官方示例中用少量参考图生成 1 分钟、1440p 的视频,并手工设计相机路径,让场景保持连贯。

重建需要多少张照片?

官方称通常 2 到 3 张即可得到较忠实重建,最多可使用超过一百张输入图;输入越多,想象补全越少。

能输出可用的 3D 资产吗?

可以。官方称其原生在 2D 图像帧与 3D 深度图上工作,可输出点云或 3D Gaussian splats,用于游戏、设计、VFX 与机器人。

现在能直接用吗?

Atlas 目前进入面向选定合作伙伴的早期访问阶段,可在官方页面提交申请;官方称它还将驱动 Marble 等产品的后续版本。