← 所有文章

World Labs Atlas:能构建 3D 场景的世界模型

蓝色海湾上一座桥的航拍画面

Atlas 是 World Labs 于 2026 年 9 月 1 日推出的新世界模型。它把文本、图像、视频和相机数据放进同一个 3D 空间上下文,再据此生成新视角、长镜头和空间重建。重点不只是生成好看的运动,而是让镜头离开原始画面后,场景仍尽量保持空间一致性。

Atlas 能做什么

  • 根据一张或多张参考图和指定相机路径生成图像与视频。
  • 从少量照片或视频重建真实空间,并展示新的视角。
  • 输出点云和 Gaussian splats 等显式 3D 结果。
  • 重新取景多机位拍摄的事件,并为机器人创建模拟场景。
Atlas 演示中绿意间深色房屋的新视角

它和普通 image-to-video 有何不同

每张图像都对应空间中的位置,因此创作者可以明确相机的位置和角度,而非只写一句文字指令。可见细节会锚定结果,未被拍到的部分则被合理补全;参考图越多,模型可推断的余地越小。

视频:从单帧到空间场景

这段 World Labs 原始演示把一个参考画面扩展成新视角和 3D 表示。

World Labs Atlas 演示:由一张图生成新视角和 3D 场景

重建、VFX 与机器人

Atlas 可使用一张到数十张照片。World Labs 表示,两三张图常能建立有用的重建基础,更多素材会提高保真度。VFX 团队可用几台普通相机获得原拍摄中不存在的视角;在机器人场景中,模型把空间地图与机器人沿路径会看到的 RGB 和深度信息联系起来。

常见问题

Atlas 何时发布?

World Labs 于 2026 年 9 月 1 日推出 Atlas。

它接受哪些输入?

文本、图像、视频帧序列、相机位姿和深度图。

文中的图片和视频来自哪里?

都来自 World Labs 的 Atlas 公告页面