行业动态

李飞飞 World Labs 发布全球首个多模态世界模型 Atlas

作者:AOYU 编辑部 · 2026年9月3日

李飞飞 World Labs 发布全球首个多模态世界模型 Atlas

2026 年 9 月 1 日,由计算机视觉先驱李飞飞联合创办的空间智能公司 World Labs 发布了新一代世界模型 Atlas,官方称其为"全球首个多模态世界模型"。与只会输出一段平面视频的传统视频生成器不同,Atlas 把文本、图像、视频、相机位姿和 3D 深度数据统一放进同一个空间上下文(spatial context),因此它生成的每一帧都与背后的三维世界保持几何一致。李飞飞称这次发布是团队的"重大里程碑",并称 Atlas 是"首个从零开始训练的多模态世界模型"、"迄今最好的相机条件世界模型"(来源:World Labs 官方博客,2026-09-01)。

Atlas 到底能做什么

World Labs 把 Atlas 称为"omni 全能模型":从零开始预训练,原生处理文本、图像、视频与 3D 数据,架构为多模态自回归扩散 Transformer。每一张图像和深度图都绑定一个显式相机位姿,共同构成空间上下文——机制上类似大语言模型把输入编码为上下文,只不过这里的上下文是一个物理空间。按官方介绍,Atlas 覆盖四类任务:

  • 相机控制生成:输入 1–6 张参考图,外加一条手工设计的相机轨迹,Atlas 可输出最长 1 分钟、1440p 分辨率的视频,镜头控制精确到像素级。你是在"导戏",而不是反复抽卡。
  • 空间重建:少则一张、多则数十张实拍照片,Atlas 就能重建真实场景,同时输出新视角画面帧和显式 3D 结果(点云、3D 高斯泼溅),可以走进去逛、也能导出使用。
  • 时空模拟:Atlas 能从输入视频中同时建模空间与时间。用 3–5 部普通手机拍下的一段表演,就能重构出可从任意机位重新取景的"子弹时间"效果,不需要专业摄影棚。
  • 图像生成:Atlas 也能根据文本生成图片和 360° 全景图,可以遵循复杂提示词、准确渲染文字,并覆盖多种视觉风格。

官方演示视频

下面是 Atlas 的官方高光演示(托管于 World Labs 公开 CDN):一张输入图像,扩展成一个可连续运镜的三维世界。

Atlas 官方演示视频。来源:World Labs — worldlabs.ai/blog/atlas

从一张照片到可行走的 3D 世界

重建能力可能是从业者最关注的部分。World Labs 报告称,在稀疏视角重建基准上,Atlas 的平均 AbsRel 误差为 25.3,优于专门做 3D 重建的先进模型 Pi3X(28.7)和 VGGT-Ω(34.7,数值越低越好)。输入照片没拍到的地方,Atlas 会用世界知识补全——给它一张只拍到机器人正面的照片,它能脑补出完整的背面和合理的草坪;给它花园、小屋和主屋的照片,它能把整个院落缝合成一个连续一致的空间。输入视角越多,模型需要"想象"的部分就越少——这是所有重建系统都要面对的取舍(来源:World Labs,2026-09)。

为什么说机器人训练才是真正的目标

World Labs 的野心不止于视觉特效。传统上,把真实环境数字化用于机器人训练需要昂贵的采集设备;而 Atlas 仅凭 24 帧普通手机视频就能重建出一个可导航的仿真环境,并生成仿真机器人在其中移动、操作物体时"相机"会看到的 RGB 与深度数据——一套面向"真实到仿真"(Real-to-Sim)的流水线,目标是廉价、可控、可规模化的训练数据。英伟达机器人业务负责人 Jim Fan(李飞飞的学生)评价这是"机器人 Real2Sim 的一大步"(来源:IT之家,2026-09-02)。

数据很亮眼,但要看清口径

World Labs 称,在相机控制能力的盲测对比中,94% 的投票者选择了 Atlas 而非 Seedance 2.5,93% 选择了 Atlas 而非 FLUX 3。需要注意:这些是厂商自报的数据——第三方报道指出,目前没有独立复现、没有研究论文、没有公布定价,Atlas 也仅面向部分合作伙伴开放早期访问。背景同样值得了解:World Labs 在 2026 年 2 月完成了 10 亿美元融资,估值约 50 亿美元(投资方包括 AMD、英伟达、Autodesk 和富达),正与谷歌 DeepMind 的 Genie 3、英伟达的 Cosmos 等同赛道模型直接竞争(来源:SiliconANGLE,2026-09-01;Startup Fortune,2026-09)。

对工业自动化意味着什么

与工业场景最相关的近期价值在仿真。如果一个仓库、工作站或产线可以靠手机扫描完成数字化,并变成机器人安全训练的环境,自动化的部署成本就会下降——思路与数字孪生一致,只是建模工作交给了生成式模型。对机器人部署团队来说,这类世界模型有望压缩"实验室里能跑"与"你产线上能跑"之间的距离。不过操作员这一侧的故事没有变化:无论仿真栈多先进,人面前的那块触控面板,仍然是监控、干预与故障处理的发生地。

正在规划机器人或机器视觉项目,需要坚固耐用、全天候在线的操作员界面?把你的应用场景告诉我们——环境、安装方式、计算平台与认证目标——我们的工程师会在 48 小时内给出规格建议。欢迎通过询盘表单提交需求。

准备好启动您的 HMI 项目了吗?

我们的工程师将协助您为项目选择合适的 HMI 硬件与软件。