一句话回答
在教会机器阅读(大语言模型)、观看与绘画(图像模型)之后,业界现在正竞相教 AI 理解空间——由此诞生了一类全新的「世界模型」:它们能从一句话、一张照片或一段视频,生成可探索的 3D 现实。
为什么「空间智能」是下一个大事件
李飞飞——用 ImageNet 帮助开启深度学习时代的研究者——有一个犀利的观点:没有空间智能,AI 是不完整的。
她的论证很简单。语言很强大,但人类智能的很大一部分是空间性的:理解物体有体积、你可以绕着它走、当你转头时世界依然存在。一个只会处理文字或平面像素的模型,永远无法真正理解物理世界或在其中行动。机器人、AR 眼镜、自动化机器、沉浸式游戏——它们都需要能进行 3D 推理的 AI。
这就是当前这波世界模型浪潮背后的赌注。而在 2025–2026 年,这个赌注从研究演示变成了正在出货的产品。
空间 AI 的三大阵营
这个领域进展飞快,但大致可分为三种路径。理解它们的差异,有助于你选对工具。
| 玩家 | 旗舰产品 | 输出类型 | 最适合 | |------|---------|---------|--------| | World Labs(李飞飞) | Marble + World API | 持久、可编辑的 3D 世界 | 创作者、构建空间应用的开发者 | | 腾讯混元 | 混元世界 2.0 | 可导出的 3DGS / Mesh 场景 | 游戏开发、虚拟场景、数字孪生 | | Google DeepMind | Genie 3 + SIMA 2 | 实时互动的视频世界 | 研究、智能体训练、具身 AI |
1. World Labs——「3D 即代码」
World Labs 由李飞飞和 Justin Johnson 联合创立,是空间智能理念最纯粹的表达。他们的标语道出了一切:「文字成为软件的通用接口;3D 正在成为空间的通用接口。」
他们的关键发布:
- Marble——前沿多模态世界模型,现已公开可用。给它文字、图片或视频,它就生成一个可探索的 3D 世界。
- World API(2026 年 1 月)——把 Marble 的世界生成能力带入你自己的应用,让开发者可以用编程方式构建空间体验。
- Spark 2.0——面向 3D 高斯泼溅(3DGS)的可流式、分级细节(LOD)系统,让这些世界能在网页上流畅运行。
- RTFM(实时帧模型)——在你互动时实时生成视频。
World Labs「3D 即代码」的定位,是这个领域中最面向开发者的愿景:像我们今天对待软件那样去生成、编辑、模拟和分享世界。
2. 腾讯混元世界——务实的主力工具
如果说 World Labs 是理想主义者,那么混元世界 2.0 就是你今天就能放进生产管线的工具。(我写过一篇专门的深度解析——点此阅读。)
简单说:给它文字、图片或视频,它就生成一个高保真、可行走的 3D 场景(3D 高斯泼溅或 Mesh 格式),你可以导出到 Unity 或 Unreal Engine 继续编辑。它覆盖了世界生成、真实世界重建(数字孪生),还有一个把场景变成可玩体验的「角色模式」。
关键是,腾讯已把混元世界家族的部分能力(以及 FlashWorld)推向开源——这对付不起企业级价格的小型创作者和独立开发者来说意义重大。
3. Google DeepMind Genie 3——实时互动世界
Genie 3 采取了最具电影感的路径。给它一个文字提示,它就生成一个动态世界,你可以以每秒 24 帧的速度实时导航,在 720p 分辨率下保持数分钟的一致性。
Genie 3 会建模物理属性——水、光照、天气——并让你在世界生成的同时穿行其中。DeepMind 明确将它定位为通往 AGI 的一块垫脚石:世界模型让你可以在无限丰富的模拟环境课程中训练 AI 智能体(比如他们的 SIMA 2 智能体)。
代价是:Genie 3 的世界是互动视频,而非可导出的 3D 资产,而且仍处于研究阶段——时长有限、长时间的一致性有限。但作为对未来方向的一瞥,它令人震撼。
这对你究竟意味着什么
这不只是研究故事。空间 AI 压缩了一切涉及 3D 的成本和时间:
对内容创作者
用一句话生成虚拟场景和背景。沉浸式故事世界。无需勘景或渲染农场,就能为视频制作 360° 环境。
对游戏开发者
快速关卡原型。不用手动搭建灰盒关卡,只需描述并迭代。导出到 Unity/UE 再精修。
对中小企业与营销人员
以前需要一整个代理公司和五位数预算的产品可视化、虚拟展厅和沉浸式品牌体验。
对机器人与仿真
按需生成的训练环境。机器人和自动系统需要在 3D 中学习,而世界模型可以产出无穷多样的场景。
对普通人
我们在文字(ChatGPT)和图像(Midjourney)上看到的平民化,正来到空间领域。你将能把一个想法、一段记忆或一张照片,变成一个可以走进去的小世界——无需任何 3D 建模技能。
诚实地谈谈局限
空间 AI 还很早期。有几点需要记住:
- 时间一致性很难。实时模型会漂移;走太远,世界可能失去连贯性。
- 精细编辑仍然笨拙。生成一个世界比精确修改其中某一处要容易得多。
- 算力很重。这些模型很吃资源,不过流式和分级细节等技巧正在快速改善。
- 标准尚未统一。3DGS、Mesh 和各种导出格式并存;从「生成的世界」到「打磨好的生产资产」的管线仍需完善。
但这些都不是忽视它的理由。这正是我们在图像和视频生成上见过的那种混乱、快速演进的早期阶段——就在它们成为日常工具的前夜。
今天如何开始探索
- 试试 Marble——在 World Labs 感受一个可探索的生成世界是什么样子。
- 试试混元世界——在 3d-models.hunyuan.tencent.com/world 体验,它在导出真实资产方面最实用。
- 看 Genie 3 演示——去 Google DeepMind 看看实时前沿。
- 从用例出发思考,而不是从技术出发。你的工作中有哪些涉及 3D、空间或环境?就从那里开始。
最后的话
我们花了 2023–2025 年学会为文字和图片写提示词。接下来的几年,将是为世界写提示词。空间 AI 不会取代 3D 艺术家,就像图像模型没有取代插画师一样——但它会大幅降低门槛,并创造出我们尚未想象过的全新格式。
李飞飞把空间智能称为让 AI「理解真实世界」的那块缺失拼图。无论它是不是通往 AGI 的道路,它显然是通往一种全新创作媒介的道路。如果你是做东西的人——游戏、视频、产品、体验——这值得你密切关注,也值得你趁它还早的时候现在就动手实验。
这几个里你试过哪个——Marble、混元世界,还是 Genie 3?欢迎在社交媒体上联系我,告诉我你做了什么。我正在收集我们本地区创作者的真实用例。
资源链接
- World Labs — Marble、World API 与空间智能宣言
- 李飞飞:《From Words to Worlds》 — 宣言原文
- 腾讯混元世界 — 亲自试用,导出到 Unity/UE
- Google DeepMind Genie 3 — 实时世界模型
- 我对混元世界 2.0 的深度解析




