美国当地时间9月1日,“AI教母”李飞飞旗下World Labs发布新一代世界模型Atlas。
Atlas可以同时处理文字、图片、视频和3D数据。与主要根据提示生成单张图片或视频的模型不同,Atlas把输入内容放进一个带有空间位置的上下文中,再根据已经看到的信息继续生成新的内容。

这意味着,一张照片输入Atlas后,镜头可以移动到原本没有拍到的位置,几张不同角度的照片可以被组织成一个完整场景,一段真实空间的视频则可以被转换成新的视角和3D结果。
World Labs将Atlas的能力分为四类:相机控制生成、空间重建、时空模拟和图像生成。Atlas目前进入早期访问阶段,未来将用于World Labs的Marble等产品。
01 一张照片,也能生成新的视角
Atlas首先改变的是图片和视频的生成方式。
传统生成模型通常根据文字决定画面内容,而Atlas可以直接接收相机位置和角度。用户提供一张或多张参考图片后,可以指定新的相机位置,Atlas根据输入内容生成对应视角。
例如,一张照片中只有站在菜地里的铜色玩具机器人,用户可以让镜头移动到机器人背后。Atlas会根据原始图片中的信息生成机器人背面,以及原图片没有拍到的周围区域。

这意味着模型需要处理的不只是画面中的像素,还要判断物体之间的空间关系,并根据已有信息推断镜头移动后应该看到什么。
相机路径也可以直接进入生成过程。World Labs展示的测试中,用户可以为镜头设计具体运动路径,而不是只用文字描述“向左移动”“从高处俯拍”等要求。Atlas按照这些路径生成连续画面。
这种控制可以进一步扩展到多个参考图片。
如果两张图片分别对应空间中的不同位置,Atlas可以把它们放入同一个空间上下文,再生成两张图片之间缺失的内容。
World Labs展示的案例中,两张没有直接关联的场景图片被放在不同位置,Atlas生成了连接两者的门、走廊和其他过渡空间。

因此,参考图片不再只是决定最终画面的视觉风格,也可以成为生成空间的一部分。
在视频生成方面,Atlas可以使用1到6张输入图片,并配合人工设计的相机路径,生成最长1分钟、1440p分辨率的视频。
用户先确定场景和镜头怎么移动,Atlas再根据这些条件生成整个过程。
同样的空间控制也可以用于生成多条不同的镜头路径。World Labs展示的案例中,输入少量图片后,可以在同一个场景中设计不同路线,让镜头经过不同区域,或者改变运动速度、长度和复杂程度。


无论镜头怎么变化,场景中的空间关系都需要保持一致。
图像生成是Atlas的另一项能力,但并不是World Labs强调的主要方向。
Atlas可以根据文字生成图片和360度全景图,也可以处理复杂提示词、生成图片中的文字,并覆盖多种视觉风格。World Labs展示的案例包括电影画面、室内设计、游戏场景以及根据文字生成的童话村庄全景图。
Atlas真正的区别,在于这些生成结果都建立在空间关系之上。
02 从真实场景重建,到让机器人进入其中
如果说上一部分解决的是“从已有信息生成新的画面”,那么空间重建解决的是“把真实世界恢复出来”。
Atlas可以从一张或多张真实世界图片重建场景。输入图片越少,模型需要自行补充的区域越多。输入图片增加后,模型获得更多真实空间信息,需要推测的部分也会减少。
World Labs用花园、房屋和小屋展示了这一过程。

只有一张花园照片时,Atlas能够重建照片中的花园,但其他区域仍需要模型推测。增加第二张小屋照片后,花园和小屋都与输入图片对应,但其他部分仍存在推测。增加第三张房屋照片后,场景能够得到更加完整的还原。
Atlas可以根据输入数量调整重建结果。World Labs称,在一些情况下,两三张图片就可以得到较为忠实的重建结果,同时模型也可以处理超过100张输入图片。
重建结果不只是一组新的图片。Atlas可以输出点云和3D Gaussian Splatting。输入一张图片时,模型可以同时生成新的视角和对应的3D几何结构。输入真实空间视频时,则可以预测每一帧的深度,再将这些信息组合成3D重建结果。
对于摄像机没有拍到的区域,Atlas仍可以进行补全。
World Labs称,Atlas生成的Gaussian Splatting可以在设备端以较高分辨率和帧率进行渲染,这一表示方式也与公司的Marble产品保持一致。
有了3D空间之后,Atlas进一步处理的是时间变化。
World Labs使用普通手机和运动相机拍摄真实场景,再利用3到5个机位重建空间。这样,即使原本没有摄影机从某个角度拍摄,也可以在后期重新生成这个角度,从而实现类似“子弹时间”的效果。


这个过程不需要专业摄影设备。World Labs的工程师和研究人员使用普通手机、三脚架和可以放进背包的小型夹具完成拍摄。
同样的能力可以用于机器人仿真。
在Real-to-Sim流程中,Atlas首先从真实环境的视频重建空间。随后,当模拟机器人在这个环境中移动时,Atlas可以生成机器人机身摄像头可能看到的RGB图像和深度数据。
World Labs展示的两个大型环境,每个环境都只使用手机视频中的24帧画面进行重建。完成重建后,可以模拟不同机器人沿不同路径移动,并生成机器人视角下的画面。

机器人操作任务还需要模拟物体之间的变化。
Atlas可以从少量真实环境记录辅助建立机器人操作仿真,并处理刚性物体、可运动部件和可变形物体。建立模拟环境后,可以改变物体位置、机器人运动、光照和背景,从同一个真实场景生成不同条件,用于机器人训练和测试。
这样,Atlas处理的对象从一张图片扩展到了一个可以被观察、移动和改变的空间。
03 一个模型,为什么能同时处理这些任务
Atlas能够把生成、重建和模拟放进同一个模型,核心原因在于它没有把图片、视频和3D信息完全分开处理。
World Labs称,Atlas是从头开始训练的多模态自回归扩散Transformer。它目前可以处理文字、图片、视频、相机位姿和3D深度图。

其中,空间上下文是整个架构的核心。Atlas会把输入内容编码成上下文,但图片并不是孤立存在的。每张图片都对应一个3D位置,图片和深度图还可以与明确的相机位姿关联起来。
模型生成新内容时,就可以同时参考输入内容以及这些内容在空间中的位置。
视频在Atlas中可以表示为连续的图片序列。不同任务则可以被组织成不同的数据序列:输入之后接输出,模型根据此前的信息逐个生成新的元素。这就是Atlas的“自回归”部分。
“扩散”部分采用rectified flow模型,通过逐步去噪生成图片、视频等高维连续数据。World Labs称,通过调整去噪步骤,可以在生成速度和质量之间进行取舍。
Transformer则作为模型的基础架构。World Labs认为,这套架构可以同时利用大语言模型、图像模型和视频模型中的技术。自回归Transformer可以使用KV caching、cache-aware routing和disaggregated serving等技术;扩散部分则可以使用diffusion distillation、classifier-free guidance、shifted noise schedules和VAE等方法。
World Labs公布了两项量化测试。
第一项测试是相机控制生成。测试给模型一张输入图片,再要求它完成1到3种电影式相机运动,包括pan、truck和crane。Atlas直接接收相机路径,其他模型则通过文字描述相机运动。第三方人工评测者随后判断生成结果是否更符合指定的相机路径。

Atlas与
World Labs称,相机轨迹越复杂,Atlas的优势越明显。
第二项测试是3D重建。测试向模型提供一组带有相机位姿的图片,要求模型预测每个输入像素对应的3D点。对比对象包括Pi3X、π³、VGGT-Ω 1B、Depth Anything 3和MapAnything。

按照统一测试协议,Atlas的平均点图重建误差为25.3‰,在这组测试中最低。该指标越低越好。
World Labs没有使用单一指标评价Atlas的全部能力。公司表示,世界模型同时涉及生成、重建和模拟,很难用一个测试完整模式衡量,因此目前重点公布了相机控制生成和3D重建两项结果。
除了测试成绩,World Labs还强调了Atlas的扩展能力。
在开发过程中,World Labs训练了不同规模和不同训练计算量的Atlas模型,并观察到随着训练计算量增加,模型获得了新的能力。World Labs预计,继续扩大训练规模后,未来的世界模型仍会沿着这一方向提升。
04 和Seedance不同的路
Atlas虽然用了Transformer架构,但其实它和Seedance之类生成模型的模式完全不同,能力也几乎垂直。
Seedance 是导演,关心的一段画面怎样往下演。Atlas则更像搭景师,它先要造出一个从不同角度看都说得通的空间。
Seedance 类的视频生成模型通过大量连续画面,学的是人怎样转身、水怎样飞溅、镜头怎样移动,以及前后几帧怎么接得自然。物理交互和物理实体随时间性的变化。
但 World Labs 在 2024 年展示的初代模型正好相反。它从一张图片出发,把图片扩成可以走进去的 3D 场景。你换一个位置,模型会补出原图没有拍到的墙面、走廊和物体背面。它不关心“下一秒发生什么”,只在一“走到没拍到的那里会看见什么”。
初代World Laba 模型生成的世界因此更像一套搭好的布景,空间存在,时间却没有真正启动。公开演示里也没有物体碰撞或用户动作改变未来的例子。
Atlas 比初代强了不少,但主线其实没有变化。初代主要是“一张图变成一个世界”,Atlas 则能同时接收文字、多张图片、视频、相机位置和深度信息,再生成新视角、深度图和 3D 场景。
它不再只凭一张图猜世界,而是把不同来源的线索放在一起,逐步补全同一个空间。这不是把旧模型简单放大,而是重做了一套更通用的底座。
从Atlas给出的所有展示中,我们都看不到生成而非拍摄的时间性变化和物理交互。“子弹时间”依赖已经拍好的多机位视频,扩展空间时还要暂停,也说明 Atlas 更像“生成一块,再把这一块接进场景”,而不是让世界一直在后台运行。而机器人部分也只说 Atlas 帮助构建仿真世界,而非预测而不是碰撞后的世界会怎样变化。
而自回归 Transformer框架,在这个系统里可能主要是用作下一个相机位置的画面预测,而非时间性和物理型的预测。
所以,这两条路线就像2024年时一样,依然是从两边修同一座桥。Seedance 能让画面随时间变化,Atlas 则是能把空间搭得更稳。
至少当下,从时间出发和从空间出发,暂时还没有走到一起。

