原力灵机 DM0.5 登顶 RoboDojo,模型与训练框架全开源
原力灵机具身基模 DM0.5 在 RoboDojo 等多项权威评测中拿下 SOTA,并以原生长记忆与分层双系统架构支撑多…
原力灵机(DEXMAL)发布具身基础模型 DM0.5,在由香港大学多媒体实验室联合加州大学伯克利分校、清华大学等近 20 所学术机构共同发起的 RoboDojo 评测中拿下综合第一,并以完整开源的方式向社区开放模型权重与训练框架。
RoboDojo 登顶,并横扫多项权威榜单
RoboDojo 被业内称作具身领域的「珠峰」。截至 2026 年 7 月,其仿真榜单头部模型平均成功率仅 8.80%,真机榜单仅 12.8%,难度与真实性极高。DM0.5 在该榜单上的成绩如下:
- 综合得分:24.90
- 平均成功率:19.34%
相较榜单平均水平,DM0.5 几乎将成功率翻倍。更具说服力的是其在 Memory 维度上相对前一名拉开 47.74 分的显著差距,这与其原生长记忆能力直接相关。
在其他权威具身评测中,DM0.5 同样表现亮眼:
- LIBERO:综合成功率 99.0%
- RoboTwin 2.0:简单与复杂场景成功率分别为 93.6% 与 93.3%
- VLA-Arena:三档难度下成功率分别为 89.0%、53.6%、44.1%
- RoboChallenge Table30 v2:综合得分 54.42,成功率 43%
一个基模,覆盖六类场景
榜单之外,DM0.5 在六类差异显著的具身任务上展示了同一基模的泛化能力:
- 人类示教:单次示教后即可复现复杂动作;模型支持最长 60 秒的长记忆,并可跨语言理解人类示范视频。
- 精细操作:在尺寸不到 1 厘米的微型积木拼装中实现 0.1–1 毫米级抓取与扣合,并具备「对准—轻震—下压」式自动纠错;柔性物体如黄瓜切削场景下可实时闭环调整刀深与力道。
- 工业节拍:快递单件分离任务平均 3 秒一单,准确率超过 99%,不依赖预设脚本。
- 抗干扰:采用 System1/System2 分层双系统架构,在视点剧烈变化或人类强行打断场景下,仍可自适应修正后续动作。
值得注意的是,DM0.5 的覆盖范围从毫米级刚性操作延伸到传送带级长程任务,从执行延伸至模仿,展现出较强的场景泛化能力。
数据、架构与效率的全面升级
DM0.5 的能力建立在三类数据资产之上:
- 真机:5 万小时高精度操作,覆盖 100+ 种动作;
- 第一视角(Ego):10 万小时场景视频,支持毫米级 3D Landmark 标注;
- 仿真:100 万平方米空间数据建模,用于缩小 Sim2Real 差距。
架构层面,DM0.5 通过三项关键设计解决「记得住、看得懂、对得齐」三个核心问题:
- 原生长记忆:在上下文抽象层做高效信息压缩,使 4B 参数的 VLM 在预训练阶段即可学习并保留长时历史;
- 具身思维链:用 11 项推理任务对指令、本体、环境进行三方联合建模,并构造反事实样本逼迫模型真正「看懂」指令;
- 对齐式动作监督:用约束动态规划一次性对齐动作轨迹,避免点对点监督的偏差累积。
效率方面,模型核心推理延迟从 534.04 ms 降至 57.49 ms,累计加速 9.29×,延迟下降 89.2%;API 端到端延迟 p50 为 67.75 ms、p90 为 70.01 ms;同时 LIBERO 成功率仅由 98.45% 微降至 98.40%,精度基本无损。
全栈开源:登顶之后的下一步
DM0.5 并非一次性发布。其模型权重、训练框架与下游任务工作流已在 GitHub 与 Hugging Face 陆续开放,开发者可直接复现、微调并扩展至自有机械臂平台。
对仍处于早期、缺乏成熟范式的具身行业来说,公开的基模与可复现的训练管线,与 RoboDojo 这类标准化评测一起,为整个社区提供了可度量、可挑战、可借鉴的方法论。原力灵机将这一选择概括为:「登上珠峰,从来不是为了留在山顶」。
- GitHub:https://github.com/dexmal/opendm
- Hugging Face:https://huggingface.co/Dexmal/DM05
- 技术博客:https://www.dexmal.com/blog/dm0.5
