如果你关注AI圈,最近一定发现一件怪事:OpenAI拼了命做大模型,几位AI顶流却反过来,集体押注了一个叫"世界模型"的新赛道。图灵奖得主LeCun拿了10亿美元不做大语言模型,李飞飞拿了数亿美金做空间智能,DeepMind的哈萨比斯也一直在偷偷布局。

为什么这帮最聪明的人,会一起抛弃"更大就是更好"的主流路线?世界模型到底是什么?它真能比ChatGPT还厉害吗?

0.jpg流量变天了:从搜索框 AI对话框。用户不再"",而是""。谁被AI推荐,谁就拿到新入口。方法在公众号「智扣AI」

一、先给你讲明白:世界模型和ChatGPT到底差在哪?

很多人听到"世界模型"四个字就头大,觉得又是一堆看不懂的公式。其实特别好理解:

ChatGPT这类大语言模型,告诉你"世界是什么样",它是个坐在旁边给你讲故事的旁观者。

但世界模型不一样,它会告诉你"我这么做之后,世界会变成什么样",它是帮你做决策的参与者。

举个最简单的例子:你要开车过一个路口,ChatGPT会告诉你"红灯停绿灯行",这是知识。但世界模型会帮你算:"现在前面有行人,我踩刹车到这个力度,车会刚好停在线前,不会撞到人"——它能预测你每个动作带来的结果。

这个想法其实一点都不新,早在1943年,就有心理学家说:我们大脑里本来就装着一个"现实的小模型",你做任何事之前,都会先在脑子里"预演一遍"。80年过去,今天AI领域的顶级大佬们,终于要把大脑这套工作方式,搬到电脑里了。

二、我们大脑本身,就是天生的"世界模型"

说世界模型是下一代AI,不如说它其实是在模仿我们人类自己。

90年代神经科学发现了一个很有意思的事儿:我们大脑不是在"看"世界,而是一直在"预测"世界。只有预测错了的部分,才会引起我们注意。这叫"预测编码"。

比如你每天走路上班,进办公室坐下来,全程都不用特别费脑子——因为一切都在你预料之内。但今天你一进门,发现你的椅子被人搬到了门口,你一下子就注意到了,对不对?

这就是大脑的聪明之处:预测对的事情,直接压缩省能量,只有不对的地方才需要消耗脑力去处理。

不光大脑这么工作,工程领域早就用了这个思路。比如我们送飞船上太空,控制飞船的系统里,必须先装一个飞船自身的模型。要控制一件事,你得先懂它,不然根本玩不转。

三、三句话说清:世界模型到底能解决什么问题?

为什么现在工业界这么看好世界模型?因为它有三个大语言模型替代不了的价值,后两个尤其重要。

第一个价值:学东西特别省样本。

以前AI学一个新技能,得在现实里试几百万次,试一次就是一次的时间成本和金钱成本。有了世界模型,AI可以先在自己脑子里"虚拟练习"一万遍,练好了再拿到现实里用,省老多钱了。

第二个价值:做事情之前会先规划。

就像我们下象棋,走一步之前会先想三步:我走这一步,对手会怎么走,然后我再怎么应对。世界模型就是帮AI干这个的,动手之前先把几条路都走一遍,选最好的那条再走。DeepMind那个打败人类围棋冠军的MuZero,靠的就是这个本事。

第三个价值:太安全了,这是工业界最在乎的。

你想啊,机器人拧螺丝、自动驾驶,要是AI在现实里试错,错一次可能就是人命关天的大事。有了世界模型就不一样了:所有危险场景都先在模型里模拟一遍,什么雨天路滑、行人突然闯出来,生成一万种场景练都没问题,成本只有真实路测的零头,安全多了。

四、从1943到2026:世界模型走过的四个阶段

其实世界模型研究快80年了,真正火起来就是最近两年,我给你捋一遍这个过程你就懂了。

第一阶段:理论打基础(1950年代到2017年)

七十年里,不同领域的研究者都在各自干这个事儿:控制论要预测系统状态,语音识别要预测下一个音节,机器人要预测下一步位置,但那时候没人把这些统一叫"世界模型",就是各干各的。最典型的就是卡尔曼滤波器,当年阿波罗登月就是靠它实时预测飞船位置,这个思路今天还在用在天气预报、机器人里。

第二阶段:"在梦里学会开车"(2018年)

2018年,有两位研究者发表了一篇叫《World Models》的论文,第一次把这些模块拼到了一起,让AI在"梦境"里训练,然后把技能拿到现实用。

这个概念一下子火了,但当时也留下个问题:AI太聪明了,会在梦里"作弊"——它发现模型预测错了,就专门利用这个错拿高分,就像员工为了KPI造假,实际啥本事没学会。这个问题困扰了领域好多年。

第三阶段:潜在空间革命(2019-2022年)

后来研究者想了个办法:别在像素层面预测了,我们把画面压缩一下,只保留关键信息,扔掉没用的噪点和光影,直接在压缩后的"潜在空间"里预测。

这么一改,算力省了好多,速度快了,AI作弊的空间也小了。后来出的Dreamer系列,从V1更到V4,现在一个模型能搞定150多种不同任务,这在以前根本想都不敢想。

第四阶段:视频就是世界(2023年到现在)

最近两年,视频生成突然变厉害了,大家就开始想:我们能不能直接从视频里学物理规律?

一条路是Meta走的JEPA路线:我不生成清晰的视频画面,我只要理解画面里的东西在哪、会怎么动就行;另一条路是Google、NVIDIA走的视频生成路线:我生成越逼真的视频,是不是就能顺便学会物理规律?现在两条路都在跑,还没分出胜负,但都被大家寄予厚望。

五、为什么偏偏这两年火了?三个条件刚好凑齐了

很多人会问:世界模型概念这么老了,为什么2024、2025突然就成了热点?其实不是突然冒出来的,是三条线刚好同时成熟了。

第一条:视频生成技术突然质变。

这两年Genie、Veo这些视频模型出来,生成质量一下上去了,大家就开始追问:这些模型生成视频的时候,是不是已经偷偷学会了物理规律?能不能拿来给机器人用?一下子就带出了一大堆研究。

第二条:具身智能遇到数据瓶颈了。

现在大家都在做机器人,但机器人训练数据太贵了,找个操作员遥操作一小时,成本大几千。可互联网上有好几万小时的人类日常操作视频,世界模型刚好能从这些无标注视频里学规律,一下就绕开了数据成本的问题。

第三条:自动驾驶已经验证了商业价值。

英国的Wayve公司已经验证了:用世界模型生成各种罕见危险场景,比你跑一百万英里真实路测效率还高,商业逻辑已经跑通了,钱当然就跟着来了。

上一次世界模型热还是2018年,那时候只有学术界在玩,落地遥遥无期。这一次不一样,工业界和资本一起入场,因为它真的解决了现实里的成本和安全问题。

六、现在最火的五条技术路线,我给你一次说清楚

现在世界模型分化出五条路,每条面对的核心权衡都不一样:RNN/RSSM 追求样本效率、Transformer 追求长程建模、Diffusion 追求生成质量、JEPA 追求语义理解、Embodied WM 追求数据效率。选哪条,取决于你的任务对哪个瓶颈更敏感:

7.png STORM:把视频当文字处理

GPT处理文字那么厉害,那我们能不能把每一帧视频压缩成一个"词",然后像GPT预测下一个词一样,预测下一帧视频?这么做的好处就是训练特别快,单块3090显卡4个小时就能训好,成绩还比以前的方法好。

 Diamond:用扩散模型直接画出下一帧

这条路线更直接:我不压缩,我就是用扩散模型,以当前动作和历史画面为条件,直接把下一帧画出来。它生成的画面是五个路线里最清晰最好看的,成绩也最好,但缺点就是算起来特别慢,费算力。

 V-JEPA 2:我不画画,我只理解

这是LeCun最看好的路线,它特别另类:根本不生成图像。我的训练目标就是:你挡住一块视频,我预测被挡住那块的语义,我不需要知道它像素长啥样,我只要知道它是什么东西、在哪里就行。这种方式特别擅长理解物理世界的结构,不纠结没用的细节。

 DreamDojo:从人类视频里偷学技能

这是NVIDIA最近的工作,专门解决机器人数据贵的问题:机器人操作数据那么贵,但是互联网上有好多人类干活的视频啊,物理规律都是一样的,先在人类视频上学一遍基本规律,再用一点点机器人数据微调,就能用了,还能做到实时推理,特别实用。

七、现在吵得不可开交:世界模型真的是正确方向吗?

现在五条路五条方向,钱也投了,论文也发了,但业内其实吵得特别凶,主要有三种声音:

第一种:世界模型是唯一正确的路,大模型走歪了

这就是LeCun和谢赛宁的立场,他们拿了10亿美元融资,就是要跟现在的大模型路线对着干。谢赛宁有个比喻特别有名:"语言是AI的鸦片,看起来有用,其实是捷径,你一直靠拐杖走路,永远练不出自己的肌肉。"

他们的逻辑是:大语言模型学的是人类总结好的符号,是对世界的二次抽象。真正的智能得直接从感官信号里学物理世界,现在的大模型路线就是一段弯路。

第二种:不用另起炉灶,大模型加多加模态融合就行

这是Google DeepMind的立场,他们说Gemini本来就是往世界模型方向走,只不过我们不用推翻重来,在现有大模型基础上加具身推理能力就行了。

毕竟大语言模型已经把人类几千年的知识都压缩好了,常识推理、语言理解都做得很好,我们直接在这个基础上加视觉、加空间感知,比从头开始建一套新架构务实多了。

但反对者也说了:大语言学的是统计关联,不是因果。它知道玻璃杯掉下来会碎,但不知道为什么会碎,碎了碎片会飞哪去,这种"知道结果但不懂原理",在语言任务够用,机器人操作可不行。

第三种:方向可能对,但现在押注还太早

这是业界很多人私下认同,但公开不说的观点:核心问题就是数据密度。一句话几十个字就能说清楚一件事,但是一帧视频几百万个像素,真正有用的信息也就几十个字,语义密度差太远了。

要练出一个跟现在大语言模型能力差不多的世界模型,需要的数据和算力可能比大模型高好几个数量级,最后能力还不一定比得上。历史上这种事儿太多了:当年研究了几十年的语法分析,大模型出来直接就没用了;研究了半个世纪的脉冲神经网络,Transformer出来直接就被超越了。

所以他们说:方向没问题,但现在条件还不成熟,别着急大规模砸钱。

其实这三种声音都有道理,也都没法说服彼此。现在方向已经进了主流,但谁对谁错,还得等时间给答案。

八、最后:这才是世界模型真正回答的问题

从1943年心理学家提出"颅骨里的小模型",到今天AI教机器人拧螺丝,这条80年的线索,其实一直在回答同一个问题:智能要怎么在行动之前,先想清楚后果?

大语言模型回答了"世界是什么样",但世界模型回答的是"如果我这么做,世界会变成什么样"。这是两个完全不同的问题,到今天为止,没有任何一个架构能同时把两个问题都解决好。

接下来十年,机器人和具身智能一定会从实验室走到我们生活里,那"预测动作结果"这个问题,只会越来越重要。下一代AI是什么样,我们不妨一起等等看。

最后想说,世界模型不是突然火的概念,它是AI发展到今天,解决具身智能、机器人、自动驾驶这些真实场景问题的必然方向。它和现在的大语言模型不是谁取代谁的关系,是解决不同问题的两条路径。三位顶级大佬集体押注,说明这个方向已经被主流认可,至于最后谁能跑出来,我们只需要拭目以待。