具身智能大脑之争:破碎到完整,世界模型如何终结机器人「翻车」时代

8月22日傍晚,第二届世界人形机器人运动会在国家速滑馆「冰丝带」开幕,现场频繁上演机器人失控的滑稽时刻。在大型组400米预赛里,某些机器人运动员仅跑过第一个转弯就应声摔倒;有的对起跑枪声似乎视若无睹,在起点处长时间保持静止;更有甚者冲过终点后与赛道器材猛烈碰撞,整个躯体散落一地。现场值班人员只好急忙搬出担架,「救完这位救那位」。

最瞩目的一幕发生在24日午后的自由体操表演赛上。一台遭遇程序故障、偏离既定路线的机器人并未倒地,反而在赛场中央缓缓转动、轻轻摇晃,整个动作显得如同芭蕾舞者般优美而流畅。技术人员之后的排查表明,这很可能是运动控制算法突然波动的结果,机器人在遭遇故障瞬间对自身姿态进行了主动校准,进而意外呈现了一段「芭蕾舞表演」。这件事恰恰揭示了适应变局的分量。展望未来,机器人若要把握周围环境,并在各类外力冲击与意想不到的突变中选择最优的行动方案,必然离不开比死板程序更为精妙的智慧。

具身智能领域的竞争重心正在进行转移,从身体维度向大脑维度倾斜。在两月前举行的第八届北京智源大会期间,北京智源人工智能研究院(以下简称「智源研究院」)的掌舵人王仲远宣布了一项重大发现,即人工智能正在经历从「预测下一个词元(Token)」向「预测下一个物理状态」转换的革命性变革。业内一致的认识是,不论硬件企业如何竞争,大脑的易用性将成为今后数年业界的分界岭。具备有效连接机器人感知、思考和执行三个环节的通用大脑,至今仍是一种稀缺资源。

这样一个被机器人从业者苦苦期盼的大脑,行业内给了它一个通俗的名字——「世界模型」。

具身智能大脑之争:破碎到完整,世界模型如何终结机器人「翻车」时代

蚂蚁灵波科技旗下R1型机器人正在展现烹饪技能。图片来源于视觉中国

支撑结构的寻觅

假如你手中拿着一杯咖啡,问某个常规大语言模型「我把咖啡松开会发生什么」,它会给出「它会跌落地面摔破」这样的答复,因为这类答案广泛存在于它的训练资料库里。

而世界模型的做法截然不同——它会观察你放手瞬间杯子离地的距离,结合所在地的重力参数,精准计算出「杯子将在0.5秒钟后掉下」,并根据杯子的材质性质推演其碎裂的程度。这一切都无需依赖已有答案,完全依靠自身的推算能力。

这就是世界模型的核心——一种重点关注物理空间的感知与预测的系统。图灵奖获得者、Meta前任首席人工智能学家杨立昆(Yann LeCun)将世界模型诠释为能够预见行为结果的内部虚拟系统,是智能体对现实的认知工具。除此以外,世界模型还拥有众多定义方式,但它们都有一个共通点——认定智能体必需通过学习现实环境的物理法则,比如玻璃坠落会破碎,来构建一个虚拟世界场景,进而可以在不进行真正行动的情况下推测不同选择的结果。

斯坦福大学的教学人员、World Labs的开创者李飞飞聚焦于三维空间的智能研究,把它定位为人工智能的下一片疆域。「……人工智能需具备认知、生成、推理并与立体空间互动的能力,创建大规模的世界模型,正是达成空间智能的核心途径。」李飞飞培养的弟子、复旦大学通用物理智能研究院的院长苏昊把目光投向物理智能,致力于让人工智能能在真实物理领域内完成各类工作,实施恰当的决策。

AMP

李飞飞

快思慢想研究院的负责人田丰的看法是,物理智能、三维空间智能和世界模型,本质上是同一事物的不同侧面。他向新闻媒体解释道,三维空间智能关注的是「能否记住房间的几何构型」,物理智能关注的是「能否做好抓、推、转这类操作」,而世界模型则是两者能够施展的基础能力。

「相比世界模型定义本身,我们更关注真实物理领域需要具备什么样的模型。」陈博远这样说道。他现年22岁,担任智源研究院行为世界模型创新中心的主任,同时是北京逆矩阵科技有限公司(以下简称「逆矩阵」)的联合创办者,这家公司主要从事通用型世界基础模型的研发。在6月份召开的北京智源大会上,逆矩阵携手智源研究院对外公布了全球第一个通用世界基础模型「悟界·Physis-v0.1」。Physis作为逆矩阵的英文译名,源自于physics(物理)的古希腊词根,寓意「万物之源」。

在陈博远的理解中,世界模型与早期大语言模型的升级演变过程存在诸多相似点。在2022年前后,金融、法律等垂直领域的专用模型吸引了广泛的行业关注;如今,通用性质的大语言模型崭露头角。同样地,对于面对真实物理世界的世界模型,研究人员也在思考是否能够打造一个能跨越不同场景、不同机制、不同目标的通用基础模型,并可广泛用于各式真实场景。

眼下,世界模型正在经历它的「奥德赛探险期」。VLA是一次重要的探索尝试。VLA即视觉—言语—行动(Visual-Language-Action),是具身智能实现感知、学习和协作的关键技术框架之一,从2023年起开始风行。它的理想目标是使机器人能像人类一样观察周边情境,理解工作指令,并完成各项操作。国内首个涉足世界模型领域的厂商极佳视界,其主打的世界模型GigaWorld就采纳了VLA路线。

VLA目前可以达成视觉信息与行动指令的连接,但仍未达到充分的「通用」境界。在这一届世界机器人交流会上,很多参展者发觉,在拥有充足训练数据的规范环境中,机器人可以出色地完成分配的工作,然而一旦环境参数产生变化,任务通常就会出现异常。某些机器人在进行快速分类和货物取用时表现良好,但若视野范围内聚集了大量观众,它就会原地停滞,无法继续完成既定任务。

宇树科技的董事长王兴兴在这届世界机器人交流会上阐述了他的看法,假如一台机器人被放入完全陌生的环境,甚至进入民众家庭后,能完成约80%的工作,那么具身智能就进入了真实的临界值。

有人将VLA视为与世界模型相提并论的技术方向,也有人认为VLA属于世界模型这个大框架的一个分支路线。更有可能的状况是,VLA与世界模型不存在简单的「高低级」区别,两者在具体应用系统中可以形成互补。现阶段,世界模型仍缺乏一个充分通用的基础模型,这就说明了为什么具身智能的通用大脑迟迟没有问世。

AMP

5月22日,广东深圳市,自变量机器人工场内,工作者正在教导人形机器人从事居家务务。

「餐桌具备吸引特性」

「’业界六大新秀’开始展开辩论了!」

在7月份召行的世界人工智能会议上,存在一个关于世界模型的「六位新星」座谈论坛,聚集了极佳视界、无界动力、自变量机器人等六家国内厂商的世界模型专家。这段话题像极了不同学派领袖人物的「华山武林大会」,深层次反映了业界对世界模型技术路径最实质的争论。

极佳视界归属于画素维度流派,志在把模型能力精研到对每一帧视频图像的深入学习和准确预测。无界动力则代表隐层空间流派,这一流派的精神领袖是杨立昆,志向是创建一个虚拟的空间,让人工智能在该空间内展开未来状态的预测。Meta在2025年6月推出的视频生成模型V-JEPA 2正属于这个路线。

众多企业则走上了融合之路,即汲取双方优点,不完全放弃视频生成的训练思路,同时充分发挥自身技术长处,推出各自专长领域的感知与预测工具。自变量机器人、智元机器人和蚂蚁灵波科技都在走这条路。

世界模型究竟应该对物理世界保持怎样程度的理解?无界动力期望它尽可能贴近物理仿真软件,倡议从几何、运动、力等因素的预测精准度来衡量世界模型。但也有观点认为,机器人毋需先变身物理学家。蚂蚁灵波科技的人士认为,物理真实性比物理精准性更重要。机器人只需意识到现实中,相同质量的钢铁下落速度快于棉花,具体快多少无须知晓,只要能观察分辨。

关于模型能力的评估标准,也存在诸多分歧。智元机器人主张强调人工智能推理的长时物理保真度,也就是模型对物理世界的还原稳定性,而自变量机器人则觉得超长推理是「伪命题」,短期推理的迅捷性更关键。若推理速率太慢导致错过决策机会,那么即使理解再全面也无济于事。

不妨说,世界模型的具体实现方式,当前还未显现绝对优势的技术方案。诸多观点的交锋背后,是各公司在为自家模型的独特优势进行争取。世界模型要突破「奥德赛探险期」,自然离不开技术方面的融合。

逆矩阵也在采纳隐层空间的方向。陈博远指出,走这条道路需要独到的训练方式。世界模型很可能很难直接采用「堆砌数据」的做法。其中很关键的一个因素是,现有可获得的视频素材和真机反馈资料里存在大量的视听冗杂。「假设我们想让模型理解如何运用一支笔,笔的蓝或红色、放置于黑板还是白板,对学习物理基本规律都没有意义。如何处理这类冗杂数据,以及如何重新收集甚至生成数据,都是巨大的难点。」

更为关键的是怎样树立因果性。当今的大型模型基本上遵循着「吞食」信息、体察相关关系、给出最符合相关规律的推测的操作方式,但「预测下一阶段物理状态」的过程显然不会如此简单。陈博远指出,状态本质上能看作是基于触觉、图像、言语等数据压低而得的隐层空间,然而模型在该空间内也许只学到了一个数据形态,基于该形态推导的结论有可能是错误的。

举个例子,假如每一段视频里餐桌上都堆放着货物,那么模型可能会推出「餐桌具备吸引特性」的结论。如果50%的视频显示货物在桌面堆放,另50%的视频显示货物在地面堆放,模型就会推论「这个宇宙有50%的概率货物被桌子吸附」。这类结论符合数据规律,但背离物理事实。

陈博远的推断是,模型需学会的是「Δ(delta)」。它在物理范畴内代表数值的变化,可视作一次操纵、一次冲击、一次转变。比如把餐桌边上的茶杯往外推动,这个推力就变成了关键的「Δ」,它引发了杯子状态的改动。模型需预测的,不只是接下来的一幅图像,而是什么类别的「Δ」导致了这样一个确定的结果。

在6月份的北京智源大会上,智源研究院公开了一套世界模型的分层系统。如同自动驾驶按自动度分为L0—L5,世界模型也根据其与现实世界的距离差值,被分为W0—W5。在这一系统内,W0等级的世界模型多是视频生成或三维重建类工具,最终目的是制作流畅精美的视频(例如谷歌发布的Veo视频生成工具),或制作一个可随意进入的三维场景(例如李飞飞World Labs公司下的Marble)。这类工具的改进目标是更加细腻的画质和稳定度。

W1代表的是行为交互类模型,例如谷歌的Genie系列工具。它们基于视频生成的基础,开始着力让模型能对行为做出反应。在此阶段的模型中,使用者可能不太在意物理准确性,这也是当前相对容易做到的。但对于W0和W1的模型来讲,它们处理的是像素维度的内容,离真实世界还有不少距离。

W2及更高的世界模型处理的是物理真实性。这一层面上,模型开始参透真实的物理社会,可以预测真实的物理结果,目前,拥有此类能力的世界模型仍旧寥寥无几。

24个月内,实现能力飞跃

即便是眼前最前沿的世界模型,在严格的评测下,也会露出不足。它们距离真正的「物理模拟器」仍有相当大的差距。

在视觉游戏中,我们常常看到球体突然消失、运行路径出错等违背物理规则的情景。这仅仅是最安全的一类「失误」,进到真实生活就没那么轻松了。有一项针对自驾领域世界模型的专项验收表明,即使是当前表现最佳的工具,如谷歌Veo 3.1,在推测物理风险比如沸油喷溅、金属遇水反应时仍存在缺陷,会遗漏重要的风险链路或误估风险程度,远未达到可靠部署的条件。

王仲远曾指出,视频生成的模型也许会生产一群在空中飞翔的猪,但物理世界不可能如此运作。假如机器人装配上一个无法分辨虚实的智能系统,它也许会误以为自己是钢铁侠,这会制造严峻危害。

世界模型当下仍处在初期试探阶段,所面对的挑战相比大语言模型要更为繁复。田丰的观点是,两种模型所需的信息类别完全不同。大语言模型学的是人类记录下来的知识,是被人工精心加工过一回的二手理解。世界模型学的是摄像机、传感系统、机械手臂直接收集的最初记录。人类精心编写的优质资料总数基本到了上限,而视频和传感系统数据每日新增的规模高出若干个数量级。

一个直观的比对是,V-JEPA 2仅有12亿参数,仅为流行大语言模型的百分之几,却用了超过100万小时的视频进行锻炼。数据获取困难和成本高是这条方向最根本的短板。与此同时,模型生产的偏差会逐帧扩大,结果在画面衍变、物体遗失、逻辑错乱。目前最领先的模型也只能维系几分钟的物理保真,而业界普遍的认知是,能够连贯、稳固地仿真一小时以上的物理步骤,才是工业应用的基准。

为此,世界模型需要现实硬件的支撑。「把所开发的模型应用到真实的物理环境里,去搜集应用这一模型所获取的信息反馈,比如什么条件下失效,什么条件下有效,什么条件下需要人工参与,这类信息是非常宝贵的。」陈博远表示,就像学会骑自行车,人在持续的尝试中感知速率和气流,维持均衡,或者由于失手而摔倒。真实世界的信息返馈是模型学会做出推断的钥匙。

当今,业界主要通过下游的应用来间接量度世界模型对物理世界的认知深度。但模型预测的精准还是欠缺,都不能直接说明它真的理解了物理现象,更说不上它所学的方法能调整到新的处境。陈博远强调,世界模型眼前仍然的需两套相互衔接的机制。第一套是模型的建造基础设施,涵盖算法、信息、训练框架等,第二套则是物理维度的基础设施,也就是把模型连入现实世界。前者搞定「怎样制造可扩充的世界模型」,后者搞定「怎样让模型在现实环境中持续改进」。

不过,陈博远相信,不管是硬件还是软件,世界模型的技术都在平稳汇聚的阶段。他预测,来年年末前,数据收集步骤和具身智能的形状也许会融合,18—24 个月内,世界基础模型的表现会显现重大的阶跃,36个月内,能在很多现实场景中实现商业应用。这与大语言模型从GPT-3到ChatGPT的演进历程完全吻合。

田丰提到,在智能驾驶里,世界模型已获得了正面的反馈。特斯拉在上年10月的国际计算机视角大会上讲述过它的神经系统物理仿真器,用车队反馈的数据训练一个虚拟驾驶环境,并表示相同的系统能移用到人形机器人。「汽车在街上行驶的每一公里都在自动记录数据,这是其他方向眼前无法具备的条件。」

对标自驾这个短期最易商用的方向,其他世界模型商品,比如Marble,田丰以为还为期不远。当在虚拟宇宙训练出的机器人,直接改换到真实情景后的成功率,高过用相同投资采纳真实数据训练得出的成功率时,历史的转折就来了。自那时起,生产合成数据比收集真实数据经济,这也许是世界模型给人类的最大颠覆。

在更多业务工作者的眼中,世界模型给了人类新的物理现实的观察视角。世界模型的用途也绝非止于具身智能这一个范畴。在陈博远的心中,它的右侧,是整个真实物理世界,涵括智慧生产、工业仿真、科研创新等。展望后日,世界模型也许能接管人类无能为力的业务,甚至主动发觉以前未知的物理法则、建议推论并实行验证。正如历尽千辛万苦归乡的奥德修斯,它能带来的闪光点,远远超越目前的所有期待。


上一篇 2026/08/26 22:20
下一篇 2026/08/26 22:21

相关推荐

  • 梅根哈利戏剧性返英定居!豪车包机现身,两个娃即将入读贵族学校

    英国王子哈利与王妃梅根携两名子女搭乘豪华私人飞机返回英国,时隔六年展开新的定居生活。夫妇二人已在享誉英伦的科兹窝地区置办住所,子女已办理私校入学手续,拟于九月开课。虽与王室关系一直不佳,但此次回归依旧引发外界关注。

    2026/08/27
    00
  • 69% vs 35%:中国为何比美国更拥抱人工智能

    中国与西方对人工智能的态度存在显著差异。调查数据显示,69%的中国人认为AI利大于弊,美国则仅35%。中国推进AI应用落地,涉及自动驾驶、医疗、消费等领域,用户直观感受便利;美国侧重前沿模型研发。中国数十年高速现代化使国民习惯了技术驱动的变革,这或许是其乐观态度的深层原因。

    2026/08/27
    00
  • 泥石流突袭尼泊尔:死亡人数已超270人,灾情持续加重

    尼泊尔与西藏毗邻地带遭遇泥石流灾害。根据最新数据,尼泊尔一侧的遇难者已达270人,加上西藏的3名遇难者,两地总计死亡人数至少为273人。中国官方公布的通报显示,西藏自治区日喀则市吉隆县在该灾难中有3人丧生。

    2026/08/27
    00
  • 朝鲜为何突然「翻脸」?美韩军售刚批准就遭猛烈炮轰

    朝鲜当局就美方向韩国出售军事装备一事表示强烈抗议,宣布将采取坚决措施予以回应。美国国务部批准向韩国供应价值1.25亿美元的AIM-9X空对空导弹系统,朝鲜认为这构成新威胁。值得注意的是,此事发生在特朗普向金正恩示好不久后。

    2026/08/27
    00
  • 全球禁令潮:12个国家如何限制青少年社交媒体使用

    在保护未成年人的呼声中,澳大利亚、法国、英国等国纷纷出台社交媒体限制措施。从完全禁令到年龄门槛,各国策略各异,执行也面临诸多挑战。了解全球如何应对这一数字时代难题。

    2026/08/27
    00

发表回复

登录后才能评论