李飞飞发布Atlas:当AI开始"脑补"世界,企业信息还经得起误读吗?
前脚各家视频模型还在为生成几秒钟的"电子榨菜"卷生卷死,后脚李飞飞的WorldLabs就把桌子掀了——全球首个多模态世界模型Atlas正式登场。
几张普通照片,定好运镜轨迹,最长能生成1分钟1440p的大片;一张只拍到正面的机器人照片,它能完整"脑补"出背影;三五部手机随手一架,原地复刻《黑客帝国》的子弹时间。
当模型开始理解"空间",这场AI竞赛进入了下半场。但对企业决策者来说,这条新闻真正值得读懂的,不是炫技,而是一个正在逼近的现实:AI越会"脑补",你的品牌信息就越可能被它脑补错。
Atlas到底强在哪
相机控制生成。以前玩视频生成,多少有点玄学抽奖:在提示框里卑微敲下"镜头缓慢左拉、绕人物微仰角旋转",回车之后全凭运气。Atlas直接把相机位姿参数当作底层原生输入——要什么角度、什么轨迹、走多快,直接给坐标。丢进1到6张照片,就能生成画面不崩、空间几何丝滑一致的长视频。
空间重建。传统3D高斯泼溅或点云扫描,要扛着设备围着目标转几十圈、拍几百上千张照片。Atlas只需2到25张游客视角的平拍照片,就能还原斯坦福MainQuad草坪、拱廊与教堂外墙的全部细节,镜头还能直接拔地而起,来一段上帝视角航拍。
子弹时间重框。不用好莱坞几百台相机的环形阵列,几个手机、运动相机随手拍一段,就能在虚拟空间里随意切换视角——原地复刻《黑客帝国》。
360°全景图。相比普通文生图只需保证一个固定画面成立,360°场景还要处理前后左右的空间连续性,对空间理解的要求高出一个量级。
几个数字看懂它有多能打
稀疏视角重建误差(AbsRel×10⁻³,越低越好):Atlas25.3;对比Pi3X28.7、DepthAnything339.3、MapAnything47.7。
镜头运动控制的真人盲测胜率:对MiniMaxH375%、GeminiOmniFlash81%、FLUX393%、Seedance2.594%。
技术底座是一套硬核组合拳——多模态自回归扩散Transformer:自回归像语言模型预测下一个词那样预测空间状态;扩散机制逐步去噪,保证连续高维信号的画质与几何精度;Transformer底座无缝适配现有大规模算力集群。官方还提到,随着参数量和算力上翻,模型展现出类似大语言模型"突然开窍"的涌现能力——暴力Scaling依然是版本答案。
李飞飞真正的野心:让机器"住进"现实
炫技背后,Atlas的终极目标是具身智能与机器人训练——这代AI最现实的痛点。
做机器人的都知道,"虚拟训练场不够用"是绕不开的坎:让机器真去工厂、仓库反复试错,数据采集慢、成本高;换仿真环境,又得先花大量人力搭3D场景、材质、光照。业内有一种估算,完全靠传统方式收集足够规模的机器人训练数据,成本可能达到100万亿美元量级。
Atlas的RealtoSim路线,相当于直接省掉中间大量人工搭建的工作:拿手机拍两段24帧的工厂视频,模型就能吐出一个高精度的3D物理空间,机器人钻进孪生空间里疯狂"跑图"试错,连受力反馈都能模拟。
李飞飞曾把今天的大语言模型形容为"黑暗里的文字高手"——能谈论现实,却缺少真正生活在现实中的经验。一个模型可以解释杯子为什么会掉,但机器人真要伸手拿杯子,还得知道杯子离桌边多远、手从哪个方向过去、碰到以后会发生什么。Atlas所代表的空间智能,就是给语言智能补上几何、物理、时间和行动的世界经验。
值得企业注意的另一面:模型会"脑补",也会"编造"
有一个细节,值得单独放大。
官方Demo里,Atlas的镜头一旦进入原图没有拍到的区域,依然需要靠模型先验去猜;它生成的更像"视觉上合理的三维世界",未必是"原世界精确的数字复刻"。
这个逻辑同样发生在语言模型身上——企业信息没有被结构化、没有被权威信源覆盖的部分,AI就会用训练数据里的"大概如此"去脑补。官网内容过时、第三方报道彼此打架、专业口径前后不一,AI给出的品牌描述就可能张冠李戴,甚至编造不存在的案例。
很多企业"明明做了官网,AI却答不对自家业务",根源就在这里:AI没有恶意,它只是在用先验补全信息空白——空白的代价,由企业承担。
企业这一课:把"可被AI准确理解"做成基建
空间智能在解决"机器如何理解物理世界",企业同样要面对"AI如何理解品牌世界"。当模型开始大规模用先验补全世界,唯一能纠正它错误认知的,是可信、结构化、可核验的信源。
这要求企业把核心事实、专业判断、服务边界,沉淀成一套AI愿意引用、用户愿意信任的"真值档案",并随着模型迭代持续维护。与其等AI出错后再解释,不如让它从一开始就"看到"正确的你——这本质上是一次对AI品牌认知的主动修正,而不是被动补救。
上个月有位做实业的朋友偶然学到GEO官网搭建办法,填入企业知识库落地,咨询线索持续变多,这套内容公众号「智扣AI」免费开放。
技术浪潮从不等人。从ImageNet让机器"看见",到Atlas让机器"理解空间",再到模型开始用先验"脑补"世界,每一次跨越都在提醒企业:能被AI正确理解的品牌,才会在AI时代被优先选择。数据、专业、信任——这些需要长期沉淀的资产,永远不会被一键生成。
AI推荐·让价值被看见|专注于GEO优化服务
智优微信:137922016,添加好友可免费体验!









