Atlas 是一款通用的“世界模型”,旨在理解、生成和模拟任何可能的世界。它作为一个能够原生处理文本、图像、视频和 3D 数据的全能模型,通过将所有输入整合到一个共享的空间上下文中来运作。基于此,Atlas 能够生成连贯的 3D 视觉内容,重建真实场景,并进行时空模拟,从而在创意、机器人技术和空间智能领域发挥作用。其性能会随着计算资源的增加而提升,显示出巨大的发展潜力。
核心功能与应用
Atlas 是一个多功能模型,能够执行涵盖世界生成、重建和模拟的广泛任务。
- 相机控制生成: 从一张或多张图像出发,以像素级的相机控制生成长达 1 分钟、1440p 分辨率的图像和视频。
- 空间重建: 利用少量(一到几十张)输入图像重建真实世界场景,生成新视角的图像和显式的 3D 输出,其性能优于专用的 3D 重建模型。
- 时空模拟: 模拟空间和时间,可用于重构视频以实现戏剧性的视觉效果(如“子弹时间”),并为机器人技术提供“从现实到模拟”(Real-to-Sim)的工作流程。
- 图像生成: 从文本提示生成图像和 360° 全景图,能够理解复杂指令、渲染文字并支持多种视觉风格。
相机控制生成
Atlas 的独特之处在于它能利用精确的相机几何信息作为原生输入,而不仅仅是依赖模糊的文本指令。这使得用户可以精确地设计每一个镜头和动作。
Atlas 首先将其输入编码为一个空间上下文。与语言模型不同,Atlas 的每张图像都在 3D 空间中拥有一个确定的位置。这种空间上下文管理解锁了全新的创意控制方式。
例如,您可以将两张不相关的参考图像放置在 3D 空间的不同位置,Atlas 会生成一个平滑过渡、将它们连接起来的虚拟世界。它会利用其世界知识和创造力,想象出门廊、走廊或其他衔接元素,将原本独立的场景融为一体。
通过结合相机路径设计和空间上下文管理,用户可以像导演一样,自主设计场景和机位,生成长而连贯的视频,而不是像操作老虎机一样随机生成内容。
空间重建
Atlas 能够从极少量的输入图像中重建真实世界空间,无需专门的捕捉设备或数百张密集视图。
- 从多张图像重建: 当输入视图无法覆盖世界的某些部分时,Atlas 会利用其丰富的世界知识来合理地填补空白。
- 信息越多,想象越少: 提供更多的输入图像会给 Atlas 更多上下文,从而减少其“想象”成分,实现对真实世界位置的精确重建。通常仅需两到三张图像,其重建效果就优于专门为此训练的模型。
- 显式 3D 输出: Atlas 不仅能输出 2D 图像和视频,还能生成点云或 3D 高斯溅射图(Gaussian Splats)等显式的 3D 输出。这对于机器人、游戏、设计和视觉特效等领域至关重要。
从单个输入图像开始,Atlas 通过联合生成新视图并估计其几何形状,来产生一个完整的 3D 世界。它能够填补任何相机从未见过的区域。
时空模拟
Atlas 既能理解世界的空间结构,也能理解世界如何随时间演变,这使其成为一个强大的世界模拟器。
- 视频重构: 仅需少量普通相机(如三台手机)拍摄的素材,Atlas 就能实现“子弹时间”那样的多视角捕捉效果。用户可以在时间静止的瞬间,从任何不可能的角度重新构建镜头。
- 机器人技术模拟: Atlas 极大地简化了机器人导航和操作的“从现实到模拟”流程。
- 导航: 用手机视频捕捉一个大型环境后,Atlas 不仅能重建其 3D 空间,还能模拟机器人在此空间中移动时,其传感器(如摄像头)会观察到的 RGB 和深度数据。
- 操作: Atlas 还能捕捉物体的移动和交互方式。一旦任务被模拟,就可以轻松改变其中的变量,如物体、位置、机器人动作、光照和背景,从而大规模生成多样化的机器人训练数据。
技术细节
Atlas 的架构被设计为一个统一的全能模型,其核心是多模态自回归扩散 Transformer。
它的输入被置于 3D 空间中以形成一个空间上下文,然后模型在此上下文的条件下生成多模态输出。
这个架构融合了以下几个关键特性:
- 多模态 (Multimodal): 原生处理多种数据类型,包括文本、图像、相机位姿和 3D 深度图。
- 自回归 (Autoregressive): 像语言模型一样,按顺序逐个生成输出元素,每个新元素的生成都以前面的序列为条件。这种设计使其能灵活适应不同任务。
- 扩散 (Diffusion): 作为一种流模型,通过逐步去噪来生成图像和视频等高维数据,并能在生成速度和质量之间取得平衡。
- Transformer: 采用 Transformer 架构,其核心的大规模矩阵乘法运算非常适合现代硬件,是世界模型的稳健基础。
性能基准与扩展性
由于 Atlas 是一个执行多种任务的全能模型,没有单一基准能完全衡量其通用性。但在两个关键任务上,它的表现非常突出。
- 相机控制生成: 在与多个顶尖视频模型的对比中,人类评估者更倾向于选择 Atlas,因为它能更好地遵循预定的相机路径,尤其是在相机轨迹更复杂时,优势更加明显。
- 3D 重建: 尽管 Atlas 是一个通用模型,但在从稀疏视图进行 3D 重建的任务上,它的性能超过了最好的开源专用重建模型。
最重要的是,有强有力的证据表明 Atlas 的能力会随着规模的扩大而持续提升。在开发过程中,更大规模的训练和计算资源解锁了新的模型能力。这预示着未来的世界模型将随着规模的不断扩大而变得更加强大。