世界模型 World Model 是什么?如何颠覆世界、运作原理、四大巨头战局与争议

世界模型(World Model)让 AI 建立“世界如何运作”的内部模型,理解空间、物理与因果,预测的是世界的下一个状态,而不是像大型语言模型那样只预测下一个字。它已在自动驾驶、机器人、游戏场景落地,但画面逼真不等于物理正确;与 LLM 相比,哪条路线才是通往 AGI 的正确路径,到今天仍是业界最大的争论之一。
(前情提要:李飞飞谈 LLM 下一步:AI 需拥有“空间智慧”才能理解真实世界,Marble 模型如何实现?)
(背景补充:Serenity:世界模型成 AI 圈最大共识,中国资金弃基础模型,转为物理 AI)

本文目录

Toggle

  • 世界模型是什么?
  • 世界模型和大型语言模型(LLM)差在哪?
  • 世界模型怎么运作?潜在空间与“预测下一刻”
  • 2026 世界模型战局:四大巨头在押什么?
  • 世界模型能做什么?自动驾驶、机器人与游戏的真实案例
  • 世界模型的争议与限制:它真的比 LLM 强吗?
  • 世界模型的未来:通往 AGI 的另一条路?

世界模型(World Model)是目前 AI 圈最常被提起、也最常被误解的名词之一。一句话定义:世界模型是一种让 AI 建立“世界如何运作”内部模型的系统,让它理解空间、物理与因果关系,并据此预测接下来会发生什么。

它跟一般人熟悉的 ChatGPT、Claude 这类大型语言模型(LLM)不是同一条技术路线:LLM 预测的是“下一个 token(词元)/字”,而世界模型预测的是“世界的下一个状态”。

世界模型是什么?

世界模型(World Model),简单来说就是让 AI 学会“脑内模拟”的技术。举个例子:人类过马路前,会在脑中自动预演“如果我现在跨出去,那辆车还要几秒到我面前”;这个预演不需要真的走到车前面再试一次才知道结果。

世界模型想让 AI 也具备这种能力:先在内部模拟各种可能,再决定下一步动作,而不是每次都要在真实世界里试错。

斯坦福大学计算机科学教授、AI 领域指标人物李飞飞把世界模型的功能拆成三块:

  • 生成(generation)
  • 理解(understanding)
  • 模拟与交互(simulation/interaction)

她创办的 World Labs,所做的产品 Marble 主打的正是第三块——模拟与交互。它被视为整条技术链里最关键、也最难的一环,因为光是“生成一张漂亮的图”不难;难的是生成一个“可以走进去、可以互动、物理逻辑还要合理”的空间。

这股风潮之所以在 2026 年集中爆发,一部分原因是产业界对 LLM 的天花板出现了明显的焦虑。当“文字接龙”这条路线的天花板越来越清楚,一批研究者开始把赌注押到另一条路:让 AI 直接学会理解“世界”本身,而不是只学会模仿人类如何描述世界。

需要先说清楚一个常见误解:世界模型不是要取代 LLM 去做对话或写作,它解决的是完全不同的问题——空间推理、物理模拟、动作规划。这也是为什么它会先在自动驾驶、机器人、游戏这几个“需要理解物理世界”的领域率先落地,而不是聊天机器人。

世界模型和大型语言模型(LLM)差在哪?

大型语言模型(LLM)建立在 Transformer 架构上,运作方式是预测序列中“下一个 token(词元)”。简单来说就是:LLM 看过极大量的文字后,学会“这句话接下来最可能出现哪个字”,整个运算过程都发生在“文字空间”里。

它从来没有真正“看过”或“模拟过”物理世界;内部没有重力、没有碰撞、没有空间坐标,只有文字之间的统计关系。

世界模型走的是另一条路。以 Yann LeCun 提出的 JEPA 为代表,它不去预测原始画面的每一个像素,也不预测文字 token,而是在“潜在空间”里预测未来状态的抽象表征。

白话说就是:它会先把不重要的杂讯细节(例如背景墙上一道反光)主动丢掉,只保留理解这个世界所需要的核心信息——这颗球正在往哪个方向滚、这辆车还要几秒到路口。因为输出建立在一个明确、可检验的内部状态上:一旦模型“内部想的”和“输出的”对不上,这种不一致相对容易被侦测出来;而这正是 LLM 难以做到的。

两者的差异,可以用下表快速对照:

| 比较项目 | | --- | | 大型语言模型(LLM) | | 世界模型(World Model) | | --- | --- | | 预测目标 | 下一個 token(文字) | 世界的下一个状态 | | 运作空间 | 文字 / 语言空间 | 潜在空间(latent space) | | 核心架构 | Transformer | JEPA、扩散模型、自回归 Transformer 等 | | 是否理解物理 | 不模拟物理,无内部世界模型 | 学习物体移动、碰撞、重力等物理规律 | | 典型错误 | 幻觉(多數模型仍在 15% 以上) | 画面逼真但物理不一定正确 | | 代表应用 | 对话、写作、代码生成 | 自动驾驶模拟、机器人训练、可探索 3D 世界 |

要提醒的一点是:“画面看起来逼真”不等于“物理上是对的”。以影片生成为基础的世界模型,因为训练目标更直接对准“看起来真不真”,不一定会保证“物理上合不合理”;在自动驾驶车、机器人这类容错率极低的场景里,这就是关键区别,也是接下来的争议核心之一。

世界模型怎么运作?潜在空间与“预测下一刻”

要理解世界模型的运作逻辑,得先搞懂两个词:潜在空间和预测下一刻。

潜在空间,简单来说就是:AI 把眼前看到的画面“压缩”成一组抽象数字,只留下对理解这个世界有用的信息,丢掉多余的视觉杂讯。

举个例子:一段行车记录器画面里,潜在空间可能只保留“前方有一辆车,距离在缩短,速度中等”这样的抽象描述,而不去记录画面里每一片树叶的颜色。这样做的好处是运算量大幅降低,而且模型学到的是“规律”,而不是死记画面。

有了潜在空间,下一步就是“预测下一刻”:给定目前的状态,加上一個动作(例如方向盘往左打),模型要预测下一個状态会长什么样子。

这个过程反复迭代,就变成一个可以“往前推演”的内部模拟器:给 AI 一个当下,它能在脑内先跑过几种可能的未来,再决定要采取哪个动作,而不必真的去现实世界里撞一次才知道结果。

JEPA(Joint Embedding Predictive Architecture,联合嵌入预测架构)是这套逻辑目前最具代表性的架构,由 Yann LeCun 在 2022 年的论文《A Path Towards Autonomous Machine Intelligence》中提出。

JEPA 的核心主张是:与其逼着模型生成每一个像素的细节(这样做既浪费算力、又容易被无关紧要的杂讯带偏),不如直接在抽象层次上比对“预测的未来”和“实际的未来”是否一致。

这也是为什么 LeCun 会说,世界模型让错误变得“可被侦测”,因为它的输出必须跟一个明确的内部表征对齐:对不上就是信号,而不是像 LLM 那样,错误只会安安静静地混在一整串看似流畅的文字里。

不过潜在空间也不是万灵丹。模型到底该丢掉哪些细节、保留哪些细节,是个没有标准答案的工程判断;丢太多会让模拟失真,丢太少又会拖垮运算效率。这也是目前各家世界模型架构设计上最大的分歧点之一。

2026 世界模型战局:四大巨头在押什么?

2026 年的世界模型赛道,已经聚集了产业里分量最重的几组人马,资金规模也大到足以说明这不是一时的技术噱头。

李飞飞创办的 World Labs 是这波浪潮最早出圈的公司。2024 年 9 月,World Labs 带着 2.3 亿美元募资、10 亿美元估值出关;2026 年 1 月传出正以约 50 亿美元估值洽谈新一轮募资;到了 2026 年 2 月 18 日,World Labs 正式宣布募得 10 亿美元,投资方包含 AMD、Autodesk、Emerson Collective、Fidelity、NVIDIA、Sea,其中 Autodesk 领投 2 亿美元,是 Autodesk 有史以来对新创公司最大的一笔投资。

累计下来,World Labs 至今募资总额约 12.3 亿美元。旗舰产品 Marble 于 2025 年 11 月开放限量 beta 测试,2026 年 2 月正式商用。输入可以是文字、照片、影片、全景图或粗略的 3D 模型;输出是可导航、可持久存储、可编辑的 3D 环境,而且单次生成会同时产出两种网格:高精度几何用的 triangle mesh,以及专门给物理引擎做碰撞侦测用的 collider mesh。

Google DeepMind 的 Genie 3 则是目前唯一做到“即时互动”的世界模型。2025 年 8 月以研究预览形式亮相,2026 年 1 月 29 日正式公开,开放给美国地区的 Google AI Ultra 订阅用户使用,同时推出 Project Genie 线上 demo,让用户可以直接生成世界、进去探索,甚至 remix 修改。

技术规格上,Genie 3 是一个 11B 引数的自回归(autoregressive)Transformer,能即时生成可以自由导航的世界;解析度 720p、每秒 24 帧(24fps),一致性可以维持数分钟不崩坏。

NVIDIA 走的是平台路线。2025 年 1 月推出 Cosmos 世界基础模型平台,2026 年 6 月 1 日再推出 Cosmos 3,号称首个完全开放的 omnimodel。它采用混合专家式 Transformer 架构,把视觉推理、世界生成、动作预测三件事整合进单一系统,涵盖文字、影像、影片、环境音、动作等多种模态。

训练资料规模惊人:约 20 兆 tokens 的多模态资料,包含近 10 亿张图片、4 亿支真实与合成影片。NVIDIA 表示,这套系统把 physical AI(实体 AI)的训练与评估周期,从过去的数个月大幅缩短到数天。Cosmos 3 底下还分出 Super(给机器人、自驾车用的高精度版本)、Nano(追求极速)、Edge 三种变体,NVIDIA 也拉了 Runway、Black Forest Labs、Skild AI 等公司组成 Cosmos Coalition 联盟。

Yann LeCun 的动作最戏剧性。2025 年 11 月,他离开待了 12 年、原本担任 FAIR 主任的 Meta,与 Alexandre LeBrun 共同创立 AMI Labs,总部设在巴黎,另在纽约、蒙特利尔、新加坡设点。

2026 年 3 月 10 日,AMI Labs 宣布种子轮募得 10.3 亿美元(约 8.9 亿欧元),投前估值 35 亿美元。这是欧洲新创史上最大的一笔种子轮募资。投资方名单包括 Bezos Expeditions、NVIDIA、Samsung、Temasek、Toyota Ventures,以及 Mark Cuban、Eric Schmidt 等知名个人投资者。LeCun 长期公开主张“LLM 走不到通用人工智能”,如今他把离开 Meta 后的整段生涯,连同 10.3 亿美元,全押在世界模型这条路线线上。

四家的定位可以简单对照如下:

| 公司 / 团队 | | --- | | 关键人物 | | 代表产品 | | 最新募资 / 规模 | | 技术定位 | | --- | --- | --- | --- | --- | | World Labs | 李飞飞 | Marble | 累计约 12.3 亿美元(2026/2 单轮 10 亿美元) | 可导航、可持久 3D 空间生成 | | Google DeepMind | DeepMind 团队 | Genie 3 | Google 内部资源支持 | 11B 引数、即时互动世界生成 | | NVIDIA | NVIDIA 团队 | Cosmos 3 | NVIDIA 自有资源 + Cosmos Coalition 联盟 | 开放式 omnimodel 平台,主攻 physical AI | | AMI Labs | Yann LeCun | JEPA 系列研究 | 种子轮 10.3 亿美元,估值 35 亿美元 | JEPA 潜在空间预测架构,理论路线最激进 |

四家公司的技术路线不完全相同:World Labs 偏重可用的 3D 空间产品、Genie 3 主攻即时互动、Cosmos 3 走开放平台、AMI Labs 专注底层架构研究。但共同的信念是一致的:

下一波 AI 突破,不会只靠把 LLM 做得更大,而要靠让 AI 真正“理解”它所处的世界。

世界模型能做什么?自动驾驶、机器人与游戏的真实案例

世界模型最先落地的场景,几乎都跟“需要理解物理世界”高度相关,自动驾驶车是最直接的例子。

新创公司 Decart 在 2026 年 6 月推出 Oasis 3,可以即时生成长达数小时、高度逼真的驾驶环境,主打帮助自动驾驶模拟那些现实中很难遇到、却攸关安全的“罕见场景”,例如暴雨中突然窜出的行人、对向来车失控偏移车道。

Oasis 3 的 API 已经开放使用,价格约每秒 2 美分。其目标是抢下 physical AI 供应链里“模拟层”的位置。Waymo 也在 2026 年 2 月发表自家的生成式模拟架构,建立在 Genie 3 之上;Tesla、NVIDIA、Wayve 等公司则各自在做类似的事。这类技术的核心价值很直接:让自动驾驶车能在“无限多种模拟场景”里反复练习,不需要真的把车开上路去撞一次才学到教训。

机器人领域是另一个重点战场。Cosmos 3、Oasis 3 这类系统可以生成可控制、多视角的模拟环境,机器人可以在这个虚拟空间里学习抓取、行走、操作物件,并反复改进动作策略。用合成数据取代真实世界的数据采集,能大幅降低机器人训练的成本与时间;过去需要实体机器人在真实环境里试错数千次才能学会的动作,现在可以先在模拟环境里跑过一轮。

游戏与内容创作则是相对“讨喜”的应用场景。Genie 3、Marble 都能从一句文字描述生成一个可以走进去探索的世界,这对游戏原型开发、虚拟场景搭建是直接的生产力工具。同时,Luma、Runway 这类原本做影片生成的新创,也开始把自家“懂物理”的影片生成模型往世界模型的方向转型。这说明世界模型并非凭空冒出的新赛道,而是影片生成技术往“可互动、可控制”演化的自然下一步。

这些案例有个共通点:世界模型的价值不在于“画面多漂亮”,而在于“能不能拿来训练、拿来模拟、拿来做决策”。这正是它和单纯的影片生成工具最大的分界线。

世界模型的争议与限制:它真的比 LLM 强吗?

世界模型阵营里最引人注目的一个赌注,来自 Yann LeCun。他离开 Meta、创立 AMI Labs、募得 10.3 亿美元种子轮,本质上是把整个职业生涯押在一个判断上:LLM 这条路线永远到不了通用人工智能,出路必须是世界模型。这种立场并非业界共识。

反方阵营里,声量最大的是 Anthropic 执行长 Dario Amodei。他的主张是:只要持续扩大模型规模,并搭配架构上的渐进改进,LLM 本身就足以突破现有限制;甚至乐观预期 2026 年有机会出现他形容为“资料中心里的天才之国”的能力跃升。

换句话说,一方认为现有路线的天花板已经看到顶,必须换路线;另一方认为天花板还没到,继续往前冲就对了。这场路线之争,目前没有任何一方能拿出决定性证据说服对方;某种程度上,两边都是在用真金白银下注一个尚未有答案的问题。

世界模型自身也不是没有破绽。前面提过,潜在空间架构让“内部不一致”的错误变得容易侦测,但这不代表世界模型不会犯错。它解决的是“错误能不能被抓到”,而不是“错误会不会发生”。更关键的问题在于:画面逼真,不等于物理正确。

以影片生成为基础的世界模型,训练目标更直接对准“看起来像不像真的”,不见得会对“物理逻辑合不合理”做出同等的最佳化。比如一颗球滚动的轨迹,看起来自然流畅,但实际的加速度、摩擦力计算未必经得起检验。这一点在自动驾驶车、机器人这类“一次出错就是事故”的应用场景里,是不能被忽视的风险。

算力与延迟成本也是现实的门槛。以扩散模型(diffusion)为基础的世界模型,每生成一帧画面都需要经过多次去噪运算。对于机器人、自动驾驶车这类要求即时反应的场景来说,这种延迟代价相当高;决策慢半拍,在真实世界里可能就是一次擦撞。

另外,根据 Open-Sora 团队的估算,想重现一个商用等级的影片生成模型,大约需要 20 万美元的算力成本;这还只是“重现”既有成果的门槛,不包含从零开发新架构的研发投入。

世界模型的未来:通往 AGI 的另一条路?

把这些线索拼在一起,可以看出一个清楚的产业讯号:2026 年,世界模型已经从一个学术概念,变成一场动用数十亿美元、聚集产业最重量级人物的路线之争。李飞飞用 Marble 证明“可导航的 3D 世界”能做成产品;Google DeepMind 用 Genie 3 证明“即时互动”技术上可行;NVIDIA 用 Cosmos 3 把它变成一个开放平台,想吃下整条 physical AI 供应链;LeCun 则用整段职业生涯与欧洲新创史上最大种子轮募资,赌上“LLM 到不了 AGI”这个判断。

这条路能不能真的通往通用人工智能,目前没有人能给出确定答案。但可以确定的是:只要自动驾驶车、机器人这类需要“理解物理世界”的应用持续扩张,世界模型的商业价值就会持续被验证,而不必等到“AGI”这个终极问题被解答。

对读者来说,与其纠结“世界模型会不会取代 LLM”,不如换个角度理解:这两条技术路线很可能会长期并存。LLM 负责语言与知识,世界模型负责空间与物理,各自解决对方解决不了的问题。

总结来说,世界模型(World Model)代表的是 AI 产业一次认真的路线分岔:当 LLM 的幻觉问题迟迟无法根治,一群顶尖研究者选择把赌注押在让 AI 直接理解物理世界本身。从李飞飞的 Marble、Google 的 Genie 3、NVIDIA 的 Cosmos 3,到 Yann LeCun 押上整个职业生涯的 AMI Labs,超过 30 亿美元资金已经投入这场战局。

它会不会是通往 AGI 的另一条路,现在下定论还太早,但可以肯定的是:这场关于“AI 该怎么理解世界”的辩论,才刚刚开始。

AMD1.42%
ADSK-3.69%
NVDA2.36%
META-2.54%
查看原文
此页面可能包含第三方内容,仅供参考(非陈述/保证),不应被视为 Gate 认可其观点表述,也不得被视为财务或专业建议。详见声明
  • 赞赏
  • 评论
  • 转发
  • 分享
评论
请输入评论内容
请输入评论内容
暂无评论