神秘黑马-莫刻机器人冲榜WorldArena,仅32张真武810E封神

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
神秘黑马-莫刻机器人冲榜WorldArena,仅32张真武810E封神
8087点击    2026-07-30 16:56

机器人实验室里,这样的画面总是反复出现:屏幕上模拟的机械臂正以完美轨迹移动,但真实世界的一边,玻璃杯还待在桌面上,甚至已被夹爪打翻。


今天的机器人世界模型都面临着这样的挑战:夹爪抓不起物体,机械臂无法与环境交互,经过了遮挡之后,预测的画面就完全错了。AI 生成的未来视频每一帧都清晰自然,但内容根本不靠谱。


这种现象背后,是具身智能领域的一大悖论:人人在卷的世界模型,物理逻辑却怎么也跟不上。


一家成立不到四个月的中国初创公司「莫刻机器人」(Muka Robotics)提出了新的解决思路。他们提出的 LJM(Latent Joint-conditional Model)世界模型,全程只用 32 张卡完成训练,就以匿名代号 SisyphusWorld 冲榜全球最权威的具身世界模型评测 WorldArena,拿到全球总榜第二,在 LIBERO 机器人操作基准上四项视觉指标全部刷新 SOTA。


神秘黑马-莫刻机器人冲榜WorldArena,仅32张真武810E封神


分项结果中,LJM 达到 89.17 Motion Quality、92.60 3D Accuracy 和 85.93 Controllability,展示了模型不仅关注单帧外观,也能较好地保持运动、空间结构与动作控制的一致性。


神秘黑马-莫刻机器人冲榜WorldArena,仅32张真武810E封神


LJM 重新定义了机器人世界模型的第一性原理:预测未来,先要在隐空间里想明白,「执行这个动作后,世界到底会发生什么」。


先理解交互,再生成预测,这可能是世界模型走向实用化的那个转折点。


为什么 99% 的生成结果

对机器人没用?


下一代通用机器人的探索方向是什么?具身智能专家十有八九会告诉你是世界模型。


目前的行业共识是:VLA(视觉 - 语言 - 动作模型)擅长建立从观察到动作的反应式映射,但缺乏对物理规律(重力、摩擦、惯性)的内在理解。引入世界模型(World Model),相当于给机器人一个「内心模拟器」,能让它们在执行动作前预测环境会如何变化。


如今,具身智能领域正在走向规模化部署,能不能持续稳定工作成为了人们关注的重点。WorldArena 榜单发布不到五个月,第一名已经易主十几次,一百多个团队前赴后继刷分,看起来一片热火朝天。但绝大多数世界模型生成的结果,对真正要落地的机器人来说也难以算得上实用。


最明显的陷阱在于大家都在做「画面党」。视频扩散模型从诞生那天起,优化目标就是在像素层面衡量生成的画面和真实图像不像,这从根上决定了它会优先拟合占画面绝大多数像素的内容:物体纹理的细腻、环境光照的反射、机器人运动的平滑…… 而具身智能需要关注的是真实世界中的物理交互:夹爪和物体接触的那十几个像素、物体被抓起时的微小形变、碰撞瞬间的状态变化,这些内容在整段视频里可能连 1% 的像素都不到。


为了把整体损失降到最低,世界模型会毫不犹豫地牺牲 1% 的物理正确性,去换 99% 的画面美观。这样,优化目标从一开始就跑偏了。最直观的证据就是 WorldArena 的公开分数:有电影级画面生成能力通用视频模型 Wan2.2 拿到了 62.35 分,CogVideoX 62.71 分,和榜单头部 73 分左右的机器人专用模型有着断层差距。


更深一层的误区在于「动作注入」。大家的默认思路是使用通用视频模型,再接入机器人的动作信号。于是有人用线性投影把动作向量接到输入层,用 FiLM 和 AdaLN 把动作做成调制参数,有人用 cross-attention 让模型去「注意」动作。这种构建思路的本质,是把动作当成了一串没有意义的低维数值信号,扔给模型自己去悟。


然而,动作的物理含义从来没有写在数值里。脱离了场景、接触状态、任务目标去谈动作,就像脱离了语境去谈一个字的含义,模型无法真正读懂,那么它思考出的动作自然也难以合理。


最后是世界模型都逃不开的记忆问题。如果世界模型的生成「转头就忘」,对于机器人的操作规划可能影响巨大。


这三个问题并不能靠 Scaling Laws 大力出奇迹的方法来解决,也不是工程能够补上的窟窿。当整个行业都在为「怎么把通用视频模型改成机器人能用的样子」而发愁的时候,很少有人停下来问一个最根本的问题:机器人真正需要的世界模型,应该是什么样子?


LJM 的思路

先把「交互」想明白


LJM 最大的改进,在于它重新拆分了世界模型的工作流,把「想清楚会发生什么」和「把结果画出来」这两件事,交给两个专门的专家各司其职。


该研究团队提出一套「双脑协作」的架构,这很像人们在开车时的工作模式:你的前额叶皮层负责推演预判,前面那辆车打了转向灯要变道,我得松油门减速;而你的视觉皮层负责处理眼前的画面、识别车道线和交通标志,大脑内部的分工明确。


LJM 也把模型拆成了两个互相配合的专家。一个是推理专家(latent reasoning expert),基于 Qwen3-VL-2B 改造,它的工作是在连续隐空间里推演剧本 —— 给定人类的语言指令、过去看到的视觉历史、接下来要执行的一整串动作,先在隐空间里把整个交互过程推演清楚 —— 机械臂接下来会移动到哪个坐标,第几帧会和物体发生接触,夹爪闭合后物体会不会被抓起,之后会被移动到什么位置;第二个是世界建模专家(world modeling expert),基于 Wan2.2-TI2V-5B 视频扩散模型改造,它需要把推理专家已经想明白的交互「剧本」渲染成一帧帧流畅真实的未来视频。


从「先生成再理解」到「先理解再生成」的变化,把之前世界模型的底层矛盾解开了。


神秘黑马-莫刻机器人冲榜WorldArena,仅32张真武810E封神

LJM 整体架构与 CoT latent 构造。左侧展示双专家通过 shared attention 联合建模,右侧展示未来本体状态、光流与视觉 latent 的交错监督。


但仅有双段式架构还不够,LJM 还给隐空间里的每一个推理 token 都绑上了明确、可计算的物理目标。具体来说,推理专家输出的每一组 token,都必须同时对三个维度的未来负责:要精确预测未来每一步机械臂末端的三维位置(本体状态),未来场景中物体的视觉状态变化(视觉动态),未来画面里每个像素的运动方向(预计算的光流)。


这三个目标全部可以从真实训练数据中直接提取,精确到帧数、具体位置、运动的方向、幅度和具体速度等信息数字上,从训练机制上就杜绝了模型「想当然」,每步推理都对真实的物理结果负责。


两个专家之间的通信方式,是 LJM 另一个容易被忽略的核心设计。之前的双模块方案,大多是推理模块把结果算出来一次性扔给生成模块,LJM 则通过 Mixture-of-Transformers(MoT)共享注意力机制,让两个大脑在 Transformer 的每一层都能双向对话:推理 token 和视频 token 被映射到同一个注意力空间中,每计算一层注意力,视频 token 就能拿到最新的推理约束,推理 token 也能看到生成到一半的视频状态,随时调整推演结果,全程信息互通。同时,原始的低维动作信号也没有被丢掉,而是保留了两条直接通路控制生成模型:一条作为 cross-attention 的上下文,一条作为 AdaLN 调制参数。


这就形成了一套完整的双路控制系统:原始动作提供毫米级的精确数值约束(移动多少厘米、夹爪张开多少毫米),推理隐变量提供高层的物理解释(当前是在自由移动、还是在对齐位置、还是在执行抓取),二者结合,打通了从控制数值到动作物理语义,再到真实视觉结果的完整通路,从机制上避免了「动作数值对了,但物理结果错了」的问题。


还有解决记忆问题的价值驱动时序条件(VTC)机制。LJM 使用算法挑选最有价值的历史帧,提升了覆盖的场景状态范围,从而增加了机器人评估、预测的准确性。


神秘黑马-莫刻机器人冲榜WorldArena,仅32张真武810E封神

VTC 对长时状态一致性的影响。 上、中、下三行分别为真实未来(GT)、不使用 VTC(No VTC)和使用 VTC(VTC)的生成结果,上方数字表示相对帧数。缺少关键历史信息时,模型难以稳定维护交互后的物体状态,容易出现物体消失或重复⽣成;引入 VTC 后,物体的数量与空间关系均更接近真实未来。


从双专家的架构职责拆分,到给推理装上物理监督,逐层双向通信,再到记忆机制,最终,世界模型获得了正确理解物理交互,能够预测未来画面的能力,给机器人的动作规划打下了基础。


除 WorldArena 外,该工作进一步基于知名机器人操作基准 LIBERO 进行了评估,LJM 在 PSNR、SSIM、FVD 和 LPIPS 四项指标上均取得最优结果,全面超越对比方法。


神秘黑马-莫刻机器人冲榜WorldArena,仅32张真武810E封神


实验结果进一步说明,强大的视频先验并不等于机器人世界模型。只有当动作被解释为与语言、场景和未来状态共同定义的交互变量时,视频生成骨干才能真正转化为可控的机器人动态模型。


成立不到四个月

冲榜全球第二


拿下 WorldArena 榜单第二名,仅与头名相差 0.58 分的莫刻机器人,是一家成立刚满三个月的初创公司。


本月,莫刻机器人联合创始人兼 CEO、香港科技大学博士池晓威在 WAIC 上聊了聊「世界模型如何赋能具身智能」。他表示,世界模型可通过生成训练数据、充当强化学习环境、学习物理表征三类路径赋能具身策略学习。这三种路径要求世界模型对状态的预测具备物理真实性。


这也决定了莫刻机器人在刚刚成立时,首先寻求解决的是让机器人理解世界这个瓶颈问题。


值得一提的是,LJM 从预训练到微调的全流程都跑在阿里云真武 810E 上,团队从写第一行代码开始,就同步做了分布式训练优化和国产算力适配,这也为未来的工程化与技术落地打好了基础。


LJM 的出现或许标志着具身智能行业正在跨过一个关键的临界点:我们终于开始走向「理解真正的物理因果」,AI 模型开始学习物理世界的运行逻辑。


当世界模型能够准确预测每一个动作的后果,有望为弥合机器人领域长期以来的 sim2real 鸿沟提供新的路径,未来的机器人可以在世界模型里预演几百万次,把所有可能的错误都犯一遍,再安全地部署到真机上。


到那个时候,准备好了的机器人,才会走进每个需要它们的真实场景。


文章来自于"机器之心",作者 "泽南"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

2
RAG

【开源免费】graphrag是微软推出的RAG项目,与传统的通过 RAG 方法使用向量相似性作为搜索技术不同,GraphRAG是使用知识图谱在推理复杂信息时大幅提高问答性能。

项目地址:https://github.com/microsoft/graphrag

【开源免费】Dify是最早一批实现RAG,Agent,模型管理等一站式AI开发的工具平台,并且项目方一直持续维护。其中在任务编排方面相对领先对手,可以帮助研发实现像字节扣子那样的功能。

项目地址:https://github.com/langgenius/dify


【开源免费】RAGFlow是和Dify类似的开源项目,该项目在大文件解析方面做的更出色,拓展编排方面相对弱一些。

项目地址:https://github.com/infiniflow/ragflow/tree/main


【开源免费】phidata是一个可以实现将数据转化成向量存储,并通过AI实现RAG功能的项目

项目地址:https://github.com/phidatahq/phidata


【开源免费】TaskingAI 是一个提供RAG,Agent,大模型管理等AI项目开发的工具平台,比LangChain更强大的中间件AI平台工具。

项目地址:https://github.com/TaskingAI/TaskingAI

3
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner