ω-EVA让机器人在起跳前预演,JEPA-WAM让机器人读懂绳子的摆动规律。至于什么时候能跳进工厂、仓库和更多真实的场景,形成商业闭环,就是“下一根绳子”的故事了。

文|许言

编辑|奇博士

8月的亦创国际会展中心,最不缺的就是机器人。

走两步是一台翻跟头的,再走两步是一台煮面的。2026世界机器人大会的主题叫人机共生,产需共融,翻译过来大概是:别光演了,干活吧。

今年行业的口味确实变了,展台上的空翻依然能聚拢人群,但投资人和工厂老板问的第一句话已经变成了,这东西部署了吗,多少钱一台,效率能不能追平人?

就在这一片交作业的氛围里,“具身花园”里的一个画面还是把人群定住了。

两台人形机器人面对面站着,手里摇着一根长绳。绳子的节奏稳下来之后,一只四足机器狗凑过去,跟着绳子的起落,一下,一下,连续跳了过去。

围观的人第一反应是好笑,第二反应是掏出手机,第三反应才回过味来:这件事其实很难。摇绳的、跳绳的,是三种形态、三套运动控制逻辑完全不同的本体,长绳又是一个持续摆动、每时每刻都在改变位置的柔性物体,任何一个环节慢半拍,绳子就缠在狗腿上了。

这是星源智联合南京大学LAMDA团队做的演示,按主办方的说法,这是全球首次异构多机协同跳长绳的实机验证。

做这场演示的公司叫星源智,成立刚满一年,智源研究院孵化,累计融资已经超过10亿元。它自己不造任何一台机器人。展台上的身体都是别人的,它卖的是大脑。

不造机器人,但每个Demo都在“说话”

跳长绳证明的是跨本体协同。分层协同学习加闭环反馈负责稳住长绳,多智能体强化学习让几个主体在持续交互里自己学会配合。

演示归演示,但它指向的问题是真的:未来的工厂和仓库里不会只有一种机器人,异构机体之间的实时配合,是单体技能再强也覆盖不了的空白。

走进星源智的展台,画风从游乐园切回了车间。星源智和中力股份联合打造的高位作业机器人擎天柱第一次对公众展出,搭载RoboBrain Pro具身大脑,能做最高10米级的高位作业;双方之前发布的具身装卸方案,单车装卸90秒、双车协同1分钟,已经和人工操作同速。

图:星源智展位“擎天柱”展示场景

叉车是个特别不性感的行业,但恰恰因为不性感,账算得最清楚。工厂主不关心你的模型参数,他只关心十米高空那个最难招人的岗位,这台机器能不能顶上去。

最能让人停下脚步的还是那张乒乓球台。搭载ω-EVA具身交互世界模型的机器人和现场观众对打,球速起来之后,机器人要持续感知、预判、调整。

这个演示妙在它没法背板,对面站着的观众每一拍都不一样,机器人必须在真实时间尺度和一个不可预测的对手周旋。世界模型进没进决策闭环,乒乓球台是最直观的测谎仪。

跳绳、叉车、乒乓球,看起来是三个毫不相干的表演,其实都在回答同一个问题:这个脑子到底懂不懂物理世界?

JEPA-WAM,世界模型的另一种用法

大会第二天,星源智发布的最新的世界模型研究成果JEPA-WAM解答了这个疑问。研究成果由联合创始人、算法负责人何嘉伟博士和实习生林艺涵主导,代码已经开源。

这篇论文值得单拿出来说,因为它回答的是当下具身智能最拧巴的一个问题。

现在行业里让世界模型参与机器人决策,大概有三条路。VLA学的是观测到动作的映射,见到什么做什么,本质是把见过的动作模式调出来,环境一变就容易懵。

视频生成路线的世界模型让机器人先渲染出未来画面再行动,理解力上去了,但推理成本高到很难端侧部署。

还有一派latent世界模型,在隐空间里预测未来,省算力,但问题却也出在这个"省"字上:未来表征在压缩中失真,细粒度空间信息随之流失;更关键的是世界建模和动作生成相互脱节,预测归预测,干活归干活,监督信号打不进动作网络里去。

图:JEPA-WAM的概述与性能表现

JEPA-WAM的做法是造了一个共享预测器。同一个预测器同时干两件事,一是预测latent状态的时序变化,二是生成连续动作。

环境动态的监督信号直接反向优化动作生成的主干网络,理解世界这件事,不是动作的参考材料,而是动作的训练信号本身。

这个设计的工程含义很实际。基座只有0.5B参数,不用大规模机器人预训练数据,不用生成像素级的未来视频,部署成本低一截。

而且这套时序监督方案可以平移,即不动原有模型的感知和动作通路,只加轻量未来Token,就能给π0.5这类已经训练好的VLA补上环境动态先验。

图:JEPA-WAM共享预测器将状态转移预测与动作生成相结合

数据也撑得住这个野心:LIBERO-Plus上,无大规模机器人预训练的JEPA-WAM拿到79.2%,是该条件下的最好成绩;把同样的监督嫁接到预训练π0.5上,平均分从84.5推到86.3,是目前整体最优。

值得留意的是星源智内部两条世界模型路线的分工。今年6月智源大会上星源智发布的ω-EVA,走的是预演、验证、执行的闭环,关心的是我这么做了会发生什么,让世界模型在执行前替机器人彩排。

JEPA-WAM关心的是另一件事,世界本身是怎么变的,把时序变化规律变成动作策略的养分。

一个是对未来的沙盘推演,一个是对变化本身的理解。两条路不通往同一个模型,但通往同一个判断,即世界模型的价值不在于生成一个漂亮的未来画面,而在于直接参与动作决策。

这个判断放在2026年的行业里看,是有“锋芒的”。视频生成派的世界模型今年声量很大,但星源智联合创始人、智源研究院具身交互世界模型实验室负责人孙振国曾在采访里说得很直白,他们不认为视频生成是具身智能的最优路线,隐空间建模的计算成本比生成未来视频低得多。

JEPA-WAM等于把这个立场写成了一篇可复现的论文,还顺手开了源。开源这个动作本身也是表态:latent路线行不行,代码在这里,各位自己跑。

不过也要承认,论文里这套方法学的是跨任务通用的视觉时序结构,当同一个观测在不同指令下应该产生截然不同的后续变化时,表现力会打折扣。

0.5B小模型低成本路线和大基座路线的对决,也远没有到盖棺的时候,英伟达Dream Zero那类大模型路线赌的是规模和数据堆出泛化,星源智赌的是机器人最终要的是能长期跑在端侧、实时闭环的系统,而不是参数量。

这两种赌注背后是对具身智能终局的两种不同想象,谁会赢,现在下结论还太早。

「卖铲人」的一周

把视野从模型拉回这家公司,星源智在WRC这一周的状态,其实是它过去一年的缩影。

定位上,它是具身智能赛道里少见的纯Tier1,只做大脑,不碰本体。硬件端是T5具身大脑域控制器,基于英伟达Thor,2070 TFLOPS,2025年底已经在智元精灵G2上批量出货,是全球首款量产的高算力具身大脑域控制器。

软件端是RoboBrain Pro加上世界模型。星源智CEO刘东的说法是,未来这个行业未必全面全栈化,更可能像自动驾驶那样分工,少数头部自研,大量本体厂商采购成熟的具身大脑。

这个卖铲人逻辑现在有数字支撑了:具身大脑算力平台已经覆盖国内70%以上的机器人本体企业,智元、极智嘉、乐聚都在用。

本届大会也能看出这种生态位的便利,跳长绳用的是别人的人形和机器狗,擎天柱的身体来自中力,星源智要做的只是让脑子住进不同的身体里,并且一次比一次住得好。

今年有人认为数据、标准、算力、场景几条线正在一起收紧,具身智能的临界点快到了。但硬币的另一面意味着,它既是爆发的起点,也是筛选的闸门。

当行业从讲故事进入交作业,能留在牌桌上的无非两种人,要么把本体的成本彻底打穿,要么像星源智这样,把智能做成标准件、按铲计价的人。

展台上的长绳还在一下下地摇。

跳绳这个行为,人类小孩学起来要摔很多次,因为绳子的节奏不在你手里,在别人手里,你得先理解那个外部世界的动态,再决定自己什么时候起跳。

这或许就是星源智在今年WRC想讲述的故事,机器人不能只会执行,它得理解世界正在怎样变化,然后在这个变化里,找到自己的节奏。

ω-EVA让机器人在起跳前预演,JEPA-WAM让机器人读懂绳子的摆动规律。至于什么时候能跳进工厂、仓库和更多真实的场景,形成商业闭环,就是“下一根绳子”的故事了。