World Labs 发布多模态世界模型 Atlas:从几张照片重建可进入的 3D 世界
李飞飞创办的 World Labs 发布了多模态世界模型 Atlas,以及基于该模型的第一个产品 Marble。这个产品试图把 AI 从"生成画面"推进到"生成可进入、可操控的世界"——用户可以从文字、图片、视频或 360 度全景图创建空间一致、高保真、持久的 3D 世界,然后在其中移动、编辑和居住。
什么是世界模型
World Labs 将自己定位为"空间智能"(Spatial Intelligence)公司。他们的核心理念是:空间智能将"看见"转化为"行动",将"感知"转化为"推理",将"想象"转化为"创造"。
世界模型不同于传统的图像生成模型。图像生成模型输出的是静态的 2D 画面,而世界模型输出的是一个完整的 3D 空间,包含:
- 相机位姿(Camera Pose)
- 3D 深度信息
- 空间关系
- 物体的几何和材质
- 可交互的环境
这意味着生成的不是一张图片,而是一个可以"走进去"的世界。
Marble 产品功能
Marble 是 World Labs 的第一个产品,基于 Atlas 世界模型构建。核心功能包括:
多模态输入
可以从多种输入创建详细的 3D 世界:
- 文字描述
- 图片参考
- 视频片段
- 360 度全景图
3D 布局控制
可以精确控制生成世界的 3D 布局,而不是完全依赖模型的随机生成。这对于需要特定空间结构的场景(如建筑设计、游戏关卡)特别重要。
交互式编辑
可以调整特定元素或重塑整个 3D 世界,完全控制生成结果。这不是一次性生成,而是可以反复迭代的创作过程。
扩展和组合世界
可以扩展、编辑和组合生成的世界,构建更大、更沉浸的环境。这意味着世界模型的输出是可组合的——多个小世界可以拼接成一个大世界。
多格式输出
支持下载和导出各种 2D 和 3D 格式,可以无缝集成到现有的工作流和管线中。这对于需要将 AI 生成的世界导入游戏引擎(如 Unity、Unreal)或 3D 软件(如 Blender)的用户来说至关重要。
应用场景
世界模型的潜在应用场景非常广泛:
- 游戏开发:快速生成游戏关卡和环境,降低美术成本
- 建筑设计:从文字或草图生成可交互的 3D 建筑模型
- 影视制作:预可视化(Pre-vis)和虚拟场景搭建
- 虚拟现实:快速生成 VR 环境内容
- 教育和培训:创建沉浸式学习环境
- 数字孪生:从照片重建物理空间的数字副本
技术意义
Atlas 代表了 AI 生成技术的一个重要方向:从 2D 到 3D,从静态到动态,从单帧到空间。传统的扩散模型(如 Stable Diffusion、Midjourney)擅长生成高质量的 2D 图像,但它们不理解 3D 空间。世界模型则原生理解相机位姿、深度和空间关系,这使得生成的内容具有空间一致性。
李飞飞作为计算机视觉领域的先驱,创办 World Labs 进入世界模型领域,也反映了行业的趋势:AI 的下一个前沿不是生成更逼真的图片,而是生成可交互、可推理的世界。
项目地址:https://www.worldlabs.ai/