展开菜单
首页 精品内容 本月促销 装机必备 Windows macOS软件 IOS软件 Android AI PDF教程 专题
全部分类

当前位置:

首页 > 硬件相关 > 李飞飞:当视频生成、NVIDIA都自称世界模型,我们需要一个分类法

李飞飞:当视频生成、NVIDIA都自称世界模型,我们需要一个分类法

李飞飞提出世界模型功能分类法,将其分为渲染器、模拟器与规划器三类,分别对应输出观测、状态和动作。模拟器被视作关键枢纽,兼具渲染与规划基础。该框架有助于厘清当前“世界模型”概念的混乱局面,推动空间智能发展。

说起“世界模型”这个标签,恐怕是2025年以来AI圈子里最热也最混乱的词汇了。Sora出世那会儿,OpenAI管它叫“世界模拟器”;Genie让你在生成的画面里穿行,也叫“世界模型”;机器人公司说自己在做这个,NVIDIA说Omniverse是它的基础设施,连游戏引擎都被拉进了这个叙事。大家都在用同一个词,但各自指的完全是另一回事。

恰好,李飞飞今天在个人Substack上发了篇新文章,专门来厘清这个概念。她的做法很经典:回到强化学习教科书里那张最基础的图——POMDP闭环:智能体→动作→状态→观测→智能体。然后她指出,现在被叫作“世界模型”的东西,其实是这个闭环的三类不同投影。输出像素(观测)的是渲染器,输出状态的是模拟器,输出动作的是规划器。分类标准清晰得像一把手术刀,就看你的输出对应闭环里的哪个环节。


(来源:《麻省理工科技评论》)

她的判断也很有意思:三者之中,渲染器商业化最成熟,但天花板明显——好看不等于物理正确;规划器最让人兴奋,但离实际部署也最远,实验室演示和真实可用之间的鸿沟大得吓人;而模拟器,是被严重低估的关键枢纽。模拟器工作在几何、物理和动力学的层面,既能向上投射为像素给人看,也能向下推导出动作后果给机器人用。掌握了模拟,就等于同时有了渲染和规划的基础。反过来,不行。

这篇文章当然也是World Labs的产品宣言。他们的Marble已经在同时输出高斯泼溅和碰撞网格,试图把渲染器和模拟器揉进一个模型里。文章末尾描绘的终局是一个统一的世界基础模型,能根据下游需求在渲染、模拟和规划之间自由切换。这个愿景能不能实现另说,但作为一个分析框架,渲染器/模拟器/规划器的三分法,确实能帮我们穿透当前“世界模型”概念里的大半噪音。

全文译出如下。

“世界是所有发生的事情的总和。”

——维特根斯坦,《逻辑哲学论》,1921

世界不是由文字构成的。

在早先的一篇文章里,我们提出空间智能是AI的下一个前沿,而世界模型是通向它的路径。现在,World Labs团队和我想再深入一层:在如今被冠以“世界模型”之名的众多事物中,哪些功能模块真正构成了这种能力?它们各自的用途又是什么?

语言模型赋予了机器对概念、词汇和推理的强大掌控力,但物理世界,无论虚拟还是真实,运行在完全不同的基底之上。语言模型学习的是文本的统计结构,世界模型学习的是空间与时间的统计结构:光如何落在物体表面,一座花园从一个从未被相机拍过的角度看起来什么样,物体如何响应力并遵循物理定律。

这使得“世界模型”成了当下AI领域最重要、同时也最被滥用的术语之一。计算机视觉、机器人学、强化学习和生成式AI都说自己在做世界模型,但各自指的是截然不同的东西。一个能生成华丽但物理上不可能的火焰的视频模型,一个即兴生成可玩游戏的语言模型,一个忠实模拟燃烧过程的物理引擎,它们都被叫作同一个名字。

古希腊人从来无法就世界由什么构成达成一致,不管是火、水还是不可分割的原子,因为“世界”从来就不是单一的东西。它始终是某个思想家为了推理某种总体性而用的替代词。AI继承了同样的问题,而且恰好发生在这个领域最需要精确性的时刻。

分类法背后的闭环

要厘清这种混乱,可以从一张比上述所有技术都更古老的图开始。所有强化学习教材,包括经典的Sutton和Barto,几十年来一直用同一幅图的变体来描述智能体如何与世界交互。这幅图的正式名称是部分可观测马尔可夫决策过程(POMDP),而“世界模型”这个术语最初的定义就属于这一传统。

一个智能体(可以是人、机器人或软件系统)执行动作。这些动作改变世界的状态。但智能体永远无法直接看到状态本身,它接收到的是观测:落在视网膜上的光子、传感器的读数、视频帧中的像素。新的观测引导新的动作,循环往复。

“状态”这个词需要拆开来看,因为不同领域它的含义会偏移。这里说的不是化学家的状态——固态、液态、气态的区别。这里是物理学家和机器人学家的状态:对世界在某一时刻所发生的一切的完整描述,包括每一个物体、每一个位置、每一个速度、每一种属性。状态是世界的底层现实,原则上完备,但对于任何智能体来说永远不可直接观测。观测是智能体对这一现实的局部视角。动作则是智能体据此做出的回应。

这个闭环(智能体→动作→状态→观测→智能体)正是赋予“世界模型”这个术语其技术含义的结构。这个短语本身更古老,可以追溯到Kenneth Craik在1943年的提议,他认为心智通过运行现实的“小比例模型”来进行推理;到了1980年代末和1990年代初,这一概念被引入了神经网络领域。这个闭环同样解释了人们今天使用这个术语时的含义。现在被称为世界模型的各种东西,实际上是同一个闭环的不同投影,每一种输出的都是闭环中不同的组成部分。

世界模型的三种功能

第一种世界模型是渲染器。渲染器输出的是观测,具体来说是面向人眼的像素,最重要的品质指标是视觉保真度。一个将文本提示转化为电影级航拍镜头的视频模型就是渲染器;像Google的Genie 3或World Labs自己的RTFM这样的交互式系统也是渲染器,它们根据用户输入实时生成画面。这类模型不具备对三维结构的显式理解。它生成的是观看者会看到的画面,而不是事物本身的样子。航拍镜头里的建筑从空中看也许完美无瑕,但试着在城市里穿行,它们就会崩塌。

第二种是模拟器。模拟器输出的是状态:一种在几何、物理或动力学上忠实的世界表征,人类和计算机程序都能在其上进行计算和交互。渲染器的契约是纯视觉的,而模拟器的契约是结构性的,它要求几何经得起检验,物理遵循牛顿定律,动力学的行为符合物理法则的预期。模拟器同时服务两类用户。建筑师、设计师、电影人、游戏&开发者等专业人士需要超越视觉可信度的准确性。强化学习智能体、机器人控制器、自动驾驶车辆等计算机程序则把模拟器当作训练场,在其中大规模地与世界交互,测试那些在现实中要么危险、要么昂贵、要么根本不可能执行的场景。

第三种是规划器。规划器输出的是动作。给定一个观测和一个目标,规划器回答的问题是:智能体下一步该做什么。在某种意义上,规划器是渲染器的逆过程。渲染器以动作为输入、产出观测,规划器以观测为输入、产出动作,从而闭合了感知-行动回路。视觉-语言-动作模型(VLA)、基于模型的系统,以及新一波的世界动作模型(World Action Models),都是规划器的不同尝试:让系统能够在非结构化的世界中决定机器人应该做什么。

以上三个类别涵盖了当前实际在落地的大部分工作,它们之间的区分在实践中很有用。但这三个类别并非根本上彼此割裂。它们共享同一套关于世界如何运作的底层知识:几何、物理、动力学。一个能从任意角度渲染一只杯子的模型,原则上也应该能模拟杯子被推动后会发生什么,并规划一只手去把它拿起来。越来越多最有意思的研究,正在有意地模糊这三者之间的边界。


图丨三种世界模型(来源:Substack)

为什么模拟是关键枢纽

在三个类别中,模拟器受到的公众关注最少,却是三者中最重要的。这篇文章想纠正这种不对称。

渲染器是目前商业化程度最高的。大量图像或文本转视频产品正在消费和企业市场快速扩张。Google的Nano Banana模型将渲染器级别的图像生成能力送到了可能数以亿计的用户手中。技术是实在的,市场也是实在的。然而渲染器优化的目标是视觉可信度而非物理准确性,这个天花板很重要。它们的输出很漂亮,但你不能用它们来设计一座建筑或训练一个机器人。

规划器是最令人兴奋也最不成熟的,它与快速演进的机器人学习领域密切相关。过去两年里,这个领域产出了不少在视频里看起来让人印象深刻的机器人演示,但我们需要坦诚地面对这些演示究竟展示了什么。几乎所有演示都局限于高度受限的实验室环境,物体种类有限,任务时长很短。没有一个经受过真实世界部署所要求的复杂度、多样性和持续时长的验证。从一段精彩的演示视频到一个能在厨房、仓库或手术室中可靠工作的机器人,中间的鸿沟依然巨大。

尽管如此,商业上的押注规模仍然可观。一波资金充裕的新进入者正在争相推出通用规划系统,而大型基础设施玩家则在将规划能力架设在更广泛的模拟堆栈之上。

模拟是连接两者的桥梁。如果说语言是对世界的抽象,像素是对世界的投影,那么几何、物理和动力学就是世界本身。模拟器必须在这个层面上工作:它是结构性的骨架,视觉表现(供渲染器使用)和动作后果(供规划器使用)都可以从中推导出来。

一个掌握了模拟的模型,能够将它的理解投射为供人类消费的像素,也能投射为供具身智能体使用的动作预测。而一个只掌握了渲染或只掌握了规划的模型,两者都做不到。这里的商业空间极其广阔。仅NVIDIA的Omniverse一项,其目标市场规模据该公司估计就超过万亿美元,涵盖工厂、仓库、供应链和数字孪生。机器人训练、自动驾驶测试、建筑可视化、工程设计、药物发现,全都依赖于某种形态的模拟。

这个领域最困难的开放性问题也集中在这里。带有显式几何、材质属性和物理标注的三维数据,比渲染器训练所用的互联网视频稀缺了几个数量级。sim-to-real差距(模拟中的物体行为与真实世界中的行为之间的差异)仍然存在。生成式模拟器在此基础上还引入了新的风险:AI生成的几何体可能看起来正确,但实际上包含自相交或错误比例的问题,导致物理模拟产生荒谬的结果。大规模的多物理模拟(刚体、可变形物体、流体、布料全部同时交互)的计算成本仍然比单一领域的模拟高出几个数量级。

在World Labs,Marble是我们在这个方向上的第一步。它接受多模态输入(文本、图像、视频或空间草图),生成可探索的3D环境,同时输出用于视觉探索的高斯泼溅(Gaussian splats)和供物理引擎操作的碰撞网格。但Marble只是一段漫长弧线的第一章。随着渲染、模拟和规划之间的界限开始消融,整个领域都在书写这个故事。

边界正在消融,以及接下来会发生什么

当前这个领域最重要的趋势是,三个类别正在开始融合。背后的共识是:渲染一个世界、模拟它、在其中行动,所需要的知识在很大程度上是相同的。沿用前面的例子,一个真正理解杯子如何放在桌上的模型(它的几何形状、材质属性、对力的响应等等),应该能够从任意角度渲染这只杯子,模拟杯子被推动后会发生什么,并规划一只手去拿起它。三个类别是同一种底层理解的三种投影。

比如,最近已有少量但在增长中的工作来自不同的机器人实验室,它们展示了一种至少在概念上成立的可能性:一个预训练的视频渲染器可以作为联合世界预测和动作预测的骨干网络,让单一模型同时想象“会发生什么”和“该做什么”,从而在渲染器和规划器之间架起桥梁。World Labs的Marble已经能从单一模型同时输出高斯泼溅和碰撞网格,消解了渲染器与模拟器之间的边界。每一个层面都在从被动输出转向交互式系统:渲染器变得可以响应动作条件,模拟器生成的世界变得更加可控和可编辑,规划器开始进行审慎推理而不仅仅是做出反应。

逻辑上的终点是一个统一的世界模型:一个基础模型,能够渲染照片级真实的视图、生成物理上准确的结构、规划动作序列,并根据下游使用者的需求在不同输出模态之间切换。我们仍将面对一系列严峻的挑战。数据格局极不均衡,渲染器坐拥海量互联网视频,而模拟器和规划器则面临3D资产和机器人示范数据的严重匮乏。针对视觉美感的优化可能会牺牲机器人或高保真模拟所需的精度。在单一架构内调和这些张力,是当今世界模型研究的核心开放问题,也是World Labs在持续演进Marble的过程中致力于解决的。


(来源:Substack)

但大方向已经很清楚。从1980年代末至今,这个领域押的始终是同一个赌注:只要世界模型足够丰富,智能体看见世界、构建世界、在其中行动所需的东西就全在里面了。这个赌注如今正在驱动一整代人的研究。而真正给它加上砝码的,是已经在发生的融合:渲染、模拟、规划三条线,每条都已经各自撑起价值数十亿美元的产业,它们起初是独立的研究方向,现在开始汇到一起。当边界消失,三者合流将重新定义一件更大的事:机器智能与它所栖居的物理世界之间的关系,也就是空间智能的长远走向。

语言给了机器一种谈论这个世界的方式。世界模型,则是机器最终得以理解、想象、推理并与之交互的途径。

参考资料:

1.https://drfeifei.substack.com/p/a-functional-taxonomy-of-world-models

注:首图由AI辅助生成

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
硬件相关
相关文章 更多
精品专题 更多
本月促销

正软商城本月促销专区,汇集办公、设计、安全、影音、系统工具及AI软件等正版软件优惠活动,提供限时折扣、特价授权和优惠购买信息,活动库存及价格以页面实时展示为准。

装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

IOS软件

正软商城iOS软件专区,精选适用于iPhone和iPad的办公、学习、影音、设计、效率及AI应用,提供功能介绍、适用设备、系统要求和正版获取方式等信息。

AI

正软商城AI软件专区,汇集AI写作、AI绘画、AI视频、AI办公、AI编程、AI翻译、智能客服和数据分析等人工智能工具,提供功能介绍、适用平台、收费方式及正版购买信息。

PDF教程

正软商城PDF教程频道提供PDF编辑、转换、合并、拆分、压缩及格式处理方法,同时介绍常用PDF软件和工具的使用技巧。

Mac软件 更多
灵活计算器
灵活计算器

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

图几
图几

图几是一款适用于 macOS 的截图、标注与美化工具,支持离线操作保障隐私。界面整理和高频系统操作被放到一起考虑,桌面或窗口内容一多时,管理起来会更省心。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Menuist
Menuist

Menuist 是一款面向 macOS 的 Finder 右键菜单增强工具,主要用来补充新建文件、快捷导航等常用操作,让日常文件管理和访问路径时更高效、更顺手。

Mole
Mole

Mole 是一款专为 Mac 设计的深度清理优化工具,涵盖缓存清理、应用管理及实时状态监控等功能。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

WINDOWS 更多
Windows 10
Windows 10

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

傲梅轻松备份
傲梅轻松备份

傲梅轻松备份是一款专业易用的数据备份软件,为重要数据提供安全保障。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Wise Folder Hider Pro
Wise Folder Hider Pro

Wise Folder Hider Pro 是一款专业级文件和文件夹隐藏加密软件,为私密数据添加多重保护。高频操作更强调就近处理,浏览、整理和跨目录移动文件时,来回切换和重复点击都会少很多。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

PinStack
PinStack

PinStack是一款轻量级的Windows平台剪贴板管理工具,优化您的剪贴板使用体验。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Seer
Seer

Seer是一款在Win平台下的空格键功能增强效率工具,只需轻敲空格键,就能预览几乎任何格式的文件。它更适合把零散的小功能集中起来使用,处理高频琐碎任务时会更省事。