World Labs 发布了 Atlas,这是一款全能模型(omni-model),能将少量普通照片转化为一个完全可导航的 3D 世界,并渲染长达一分钟的 1440p 视频。该公司表示,这项技术创建了一个“从现实到模拟”(real-to-sim)的流水线。

为什么从扁平序列转向 3D 如此重要

目前大多数多模态 AI 系统将输入视为一维或二维流——文本字符串、图像网格或视频帧。这种设计迫使模型从缺乏显式几何结构的数据中推断空间关系,从而限制了生成的视频和 3D 重建的保真度。Atlas 摒弃了这种方法。模型处理的每个 token 都与三维空间中的一个具体点相关联,该公司将这种技术称为“空间锚定”(spatial anchoring)。通过在文本、图像、视频和 3D 数据上从零开始训练,并采用一种能够感知 3D 甚至 4D(时间)结构的架构,Atlas 可以直接理解并操纵几何结构。

从“老虎机式”视频转向相机控制生成

当前的生成式视频工具依赖模糊的文本提示词来移动虚拟相机,往往会产生不可预测的结果。Atlas 用几何输入取代了提示词:用户指定相机姿态或路径,模型便从该精确视角渲染场景。在演示中,该系统生成的视频平滑且具有高分辨率,并在相机移动过程中保持一致——这是迈向专业级控制的一步。

利用极少图像重建世界

Atlas 可以仅凭一张到几十张图像重建复杂的环境,且无需任何专门的采集硬件。在一次公开演示中,该模型利用一组大学校园广场的地面照片,合成了符合预期布局的航拍视角。相比之下,VGGT 和 InfiniteVGGT 等竞争模型在相机移动时经常会出现模糊纹理或几何错误;而 Atlas 在整个过程中都能保持结构的完整性。

除了视频,该模型还能输出原生 3D 格式——点云(point clouds)和 3D 高斯泼溅(3-D Gaussian splats)。点云是空间中编码表面形状的点集;高斯泼溅则将每个点存储为一个微小的、平滑变化的斑块(blob),从而实现对精细细节的高效渲染。通过在 RGB 颜色的基础上提供深度信息,Atlas 能将几张智能手机拍摄的照片转化为一个可以从任何角度进行探索的数字孪生体。

面向机器人的“从现实到模拟”

机器人开发者长期以来一直在努力弥合现实世界数据与模拟训练环境之间的鸿沟。Atlas 有望通过生成机器人在重建房间中看到的精确传感器数据流来填补这一空白。开发者随后可以在数字孪生体中更改物体、光照或背景,从而从单次现实世界采集中创建数千个变体场景。World Labs 展示了利用从一家专注于场景合成的初创公司收购的技术实现的这一工作流;该流水线产生的变体足以让五个不同的机器人平台在无需人工干预的情况下自主运行一小时。

基准测试与性能声明

在直接对比测试中,人类评估者在 94% 的成对比较中更青睐 Atlas 的相机引导视频(优于某领先竞争对手),并在 81% 的案例中优于另一款主流模型。在重建方面,Atlas 实现了 25.3 的中值误差,击败了报告更高误差得分的对手。该模型结合了大语言模型的速度优势(利用键值 (KV) 缓存来复用中间计算)与扩散模型(通过迭代优化图像)的高质量输出。

潜在缺点与悬而未决的问题

World Labs 的公告虽然有令人印象深刻的演示作为支撑,但该技术仍处于早期阶段。训练和运行一个能够处理高分辨率文本、图像、视频和 3D 数据的模型需要巨大的计算量,而该公司尚未披露硬件规格或推理成本。目前的基准测试依赖于人类偏好和中值误差指标;它们尚未展示 Atlas 在下游任务(如与纯现实数据相比的机器人操作成功率)中的表现。批评人士还可能指出,虽然该模型可以从少量图像中生成看似合理的几何结构,但在需要精确测量时,它无法取代激光雷达(lidar)扫描或结构光采集的高保真度。

下一步值得关注的方向

  • 机器人平台的采用情况 – 如果机器人团队将 Atlas 生成的世界集成到其训练循环中并报告了可衡量的收益,那么关于更廉价、更多样化模拟的说法将获得公信力。
  • 内容创作管线 – 工作室和游戏开发人员利用 Atlas 进行快速原型设计,可以揭示该模型的原生 3D 输出是否符合现有的资产管线。
  • 开源或第三方评估 – 独立研究人员通过复现基准测试数据,将有助于确认该模型相对于当前标准的优势。
  • 硬件与成本披露 – 了解推理所需的计算预算,将决定 Atlas 是可以在边缘设备上运行,还是仅限于云端服务。

核心结论

Atlas 表明,将 AI token 锚定在物理空间中,可以让单个模型仅凭极少的视觉输入,就能生成、重建并模拟整个环境。如果其承诺的性能能够在不产生高昂计算成本的情况下扩展到现实世界的部署,该模型可能会重塑机器人的学习方式以及沉浸式内容的构建方式,将寥寥几张照片转化为一个完全互动的数字世界。