近日,全球大规模具身智能真机评测平台 RoboChallenge 更新 Table 30 V2 榜单,日本通信巨头 KDDI 集团旗下核心研究机构 KDDI 综合研究所( KDDI Research, Inc. )提交的 VLA-DM0.5,以40.67%成功率与54.42过程分,两项成绩均位列第一,登顶全球榜首,也成为 RoboChallenge Table 30 V2首个突破50分的模型。
值得关注的是,VLA-DM0.5 并非从零开始训练,而是以中国具身智能公司原力灵机(Dexmal)开源发布的DM0.5作为基础模型,通过后训练完成。
之前我们就报道过,DM0.5模型在RoboColiseum上拿到了四个第一。
而这次,一个海外头部研究机构在这个开源底座上进行了优化开发,并拿到全球第一,为开源基座模型的真实可用性提供了一份来自真机的注脚。
原文链接:RoboChallenge 榜首又变了,海外团队用中国的开源具身底座拿下了第一
真机实战,VLA-DM0.5 评测表现一览
RoboChallenge由原力灵机联合 Hugging Face 于 2025 年 10 月共同发起,是全球首个大规模具身智能真机评测平台。
与不少具身智能评测依赖仿真环境不同,RoboChallenge 采用的是大规模远程真机评测机制,平台目前部署了 UR5、DOS-W1、ARX5、ALOHA 等主流机型,核心评测集 Table30 包含 30 个标准化桌面操作任务,覆盖家庭、厨房、工作等场景。
2026 年 3 月更新的 Table 30 V2 版本,进一步聚焦高难度双臂协同、柔性物体操作等更贴近真实环境的操作能力。
在这样一个以真机实测为标准的评测体系中登顶,意味着 KDDI Research 的 VLA-DM0.5 模型在真实物理环境下具备了较为稳定的自主操作能力,而非仅停留在数据层面的表现。
VLA-DM0.5 30项任务最终得分
Table 30 V2 以成功率和过程分衡量任务完成度与执行质量,VLA-DM0.5 两项指标均位列榜首。
从 30 项任务的结果分布看:
22 项任务取得非零成功率,其中 11 项达到 60% 及以上,非零成功记录覆盖全部四种机器人本体;
9 项任务达到 80 分及以上,高分任务涵盖目标驱动抓取、物品分类、连续放置和双臂协同等多类操作。
综合来看,VLA-DM0.5 兼具跨本体任务覆盖与复杂操作完成能力,整体优势由多个任务和能力维度共同支撑。
这个模型能力边界怎么样?
VLA-DM0.5 的高分任务主要集中在目标辨识与空间操作、双臂协同与连续放置、精细工具使用与柔性物体操作三类,呈现了模型在复杂操作中的能力边界。
我们在看到 VLA-DM0.5 在不同机器人本体中得分较高、且具有典型操作难度的代表任务后,有一些结论。
目标辨识与空间操作
取出绿色积木(pick_out_the_green_blocks):100% SR / 100 Score
给花浇水(water_the_flowers):90% SR / 94 Score
物品分类(item_classification):80% SR / 93.5 Score
三项任务分别涉及指定目标定位、目标区域对准与物品分类归位,共同考察模型将视觉信息转化为抓取位姿和动作轨迹的能力。这些结果体现了 VLA-DM0.5 在目标辨识、空间定位和操作执行链路上的稳定性。
pick_out_the_green_blocks
water_the_flowers
item_classification
双臂协同与连续放置
将物体放入抽屉(place_objects_into_desk_drawer):90% SR / 92.5 Score
堆叠碗具(stack_bowls):90% SR / 95 Score
两项任务均需使用Dexmal的Mirror(DOS-W1)机器人完成多次抓取、姿态调整和连续放置,涉及双臂配合、目标区域约束与多步误差控制。两个任务均达到90%成功率,说明模型在双臂协同和多阶段动作衔接方面比较稳定。
place_objects_into_desk_drawer
stack_bowls
精细工具使用与柔性物体操作
用小勺舀取物体(scoop_with_a_small_spoon):60% SR / 66 Score
用软布包裹物体(wrap_with_a_soft_cloth):40% SR / 54 Score
前者需控制勺具的插入位置、倾角、舀取轨迹与倾倒姿态;后者需根据布料形态变化持续调整双臂动作。这个结果体现了 VLA-DM0.5在精细工具控制与柔性物体操作中的有效执行能力。
scoop_with_a_small_spoon
wrap_with_a_soft_cloth
可适配性高的开源底座
VLA-DM0.5 的起点,Dexmal开源的具身模型 DM0.5。
DM0.5 定位于面向开放世界的通用具身基础模型(Foundation Model), 采用 4B VLM 多模态主干和 680M Action Expert 组成的 VLA 架构,围绕历史上下文、具身推理、动作监督和数据质量进行了系统升级,在长程记忆、指令理解、动作连续性、抗干扰和跨任务泛化等方面形成了更加完整的基础能力。
目前,DM0.5 的模型权重、训练框架及完整下游工作流已上线 GitHub 与 Hugging Face,原力灵机的开源训练框架 Dexbotic 也已全面接入 DM0.5,支持 Full SFT 与 LoRA 微调,打通从数据准备、训练、高性能推理到评测的完整流程。
附开源地址:
DM0.5:https://www.dexmal.com/blog/dm0.5
Dexbotic:https://github.com/dexmal/dexbotic
一个开源基础模型是否具备足够的通用性和工程成熟度,往往需要通过第三方团队的实际使用来检验。
KDDI Research 作为外部团队,选择基于 DM0.5 做后训练,并最终在 RoboChallenge Table 30 V2 上拿到榜首,至少说明一件事:这个开源底座具备被第三方继续开发的空间。
对一个开源具身模型来说,这一点很重要。
模型开源之后,真正的检验不是下载量,也不是发布时展示了多少 demo,而是其他团队能不能拿它接入自己的数据、训练流程和决策策略,并做出新的结果。
当然,VLA-DM0.5 的最终成绩不能完全归功于 DM0.5。KDDI 在多模型融合、后训练和决策优化上的工作,同样是这次登顶的关键。
更准确地说,DM0.5 提供了一个可用的起点,KDDI 则验证了这个起点还能继续往上走。