☰
RoboChallenge 榜首又变了,海外团队用中国的开源具身底座拿下了第一
2026/9/30 18:34:38 网站建设 项目流程

近日,全球大规模具身智能真机评测平台 RoboChallenge 更新 Table 30 V2 榜单,日本通信巨头 KDDI 集团旗下核心研究机构 KDDI 综合研究所( KDDI Research, Inc. )提交的 VLA-DM0.5,以40.67%成功率与54.42过程分,两项成绩均位列第一,登顶全球榜首,也成为 RoboChallenge Table 30 V2首个突破50分的模型。

值得关注的是,VLA-DM0.5 并非从零开始训练,而是以中国具身智能公司原力灵机(Dexmal)开源发布的DM0.5作为基础模型,通过后训练完成。

之前我们就报道过,DM0.5模型在RoboColiseum上拿到了四个第一。

而这次,一个海外头部研究机构在这个开源底座上进行了优化开发,并拿到全球第一,为开源基座模型的真实可用性提供了一份来自真机的注脚。

原文链接:RoboChallenge 榜首又变了,海外团队用中国的开源具身底座拿下了第一

真机实战,VLA-DM0.5 评测表现一览

RoboChallenge由原力灵机联合 Hugging Face 于 2025 年 10 月共同发起,是全球首个大规模具身智能真机评测平台。

与不少具身智能评测依赖仿真环境不同,RoboChallenge 采用的是大规模远程真机评测机制,平台目前部署了 UR5、DOS-W1、ARX5、ALOHA 等主流机型,核心评测集 Table30 包含 30 个标准化桌面操作任务,覆盖家庭、厨房、工作等场景。

2026 年 3 月更新的 Table 30 V2 版本,进一步聚焦高难度双臂协同、柔性物体操作等更贴近真实环境的操作能力。

在这样一个以真机实测为标准的评测体系中登顶,意味着 KDDI Research 的 VLA-DM0.5 模型在真实物理环境下具备了较为稳定的自主操作能力,而非仅停留在数据层面的表现。

VLA-DM0.5 30项任务最终得分

Table 30 V2 以成功率和过程分衡量任务完成度与执行质量,VLA-DM0.5 两项指标均位列榜首。

从 30 项任务的结果分布看:

  • 22 项任务取得非零成功率,其中 11 项达到 60% 及以上,非零成功记录覆盖全部四种机器人本体;

  • 9 项任务达到 80 分及以上,高分任务涵盖目标驱动抓取、物品分类、连续放置和双臂协同等多类操作。

综合来看,VLA-DM0.5 兼具跨本体任务覆盖与复杂操作完成能力,整体优势由多个任务和能力维度共同支撑。

这个模型能力边界怎么样?

VLA-DM0.5 的高分任务主要集中在目标辨识与空间操作、双臂协同与连续放置、精细工具使用与柔性物体操作三类,呈现了模型在复杂操作中的能力边界。

我们在看到 VLA-DM0.5 在不同机器人本体中得分较高、且具有典型操作难度的代表任务后,有一些结论。

目标辨识与空间操作

  • 取出绿色积木(pick_out_the_green_blocks):100% SR / 100 Score

  • 给花浇水(water_the_flowers):90% SR / 94 Score

  • 物品分类(item_classification):80% SR / 93.5 Score

三项任务分别涉及指定目标定位、目标区域对准与物品分类归位,共同考察模型将视觉信息转化为抓取位姿和动作轨迹的能力。这些结果体现了 VLA-DM0.5 在目标辨识、空间定位和操作执行链路上的稳定性。

pick_out_the_green_blocks

water_the_flowers

item_classification

双臂协同与连续放置

  • 将物体放入抽屉(place_objects_into_desk_drawer):90% SR / 92.5 Score

  • 堆叠碗具(stack_bowls):90% SR / 95 Score

两项任务均需使用Dexmal的Mirror(DOS-W1)机器人完成多次抓取、姿态调整和连续放置,涉及双臂配合、目标区域约束与多步误差控制。两个任务均达到90%成功率,说明模型在双臂协同和多阶段动作衔接方面比较稳定。

place_objects_into_desk_drawer

stack_bowls

精细工具使用与柔性物体操作

  • 用小勺舀取物体(scoop_with_a_small_spoon):60% SR / 66 Score

  • 用软布包裹物体(wrap_with_a_soft_cloth):40% SR / 54 Score

前者需控制勺具的插入位置、倾角、舀取轨迹与倾倒姿态;后者需根据布料形态变化持续调整双臂动作。这个结果体现了 VLA-DM0.5在精细工具控制与柔性物体操作中的有效执行能力。

scoop_with_a_small_spoon

wrap_with_a_soft_cloth

可适配性高的开源底座

VLA-DM0.5 的起点,Dexmal开源的具身模型 DM0.5。

DM0.5 定位于面向开放世界的通用具身基础模型(Foundation Model), 采用 4B VLM 多模态主干和 680M Action Expert 组成的 VLA 架构,围绕历史上下文、具身推理、动作监督和数据质量进行了系统升级,在长程记忆、指令理解、动作连续性、抗干扰和跨任务泛化等方面形成了更加完整的基础能力。

目前,DM0.5 的模型权重、训练框架及完整下游工作流已上线 GitHub 与 Hugging Face,原力灵机的开源训练框架 Dexbotic 也已全面接入 DM0.5,支持 Full SFT 与 LoRA 微调,打通从数据准备、训练、高性能推理到评测的完整流程。

附开源地址:

  • DM0.5:https://www.dexmal.com/blog/dm0.5

  • Dexbotic:https://github.com/dexmal/dexbotic

一个开源基础模型是否具备足够的通用性和工程成熟度,往往需要通过第三方团队的实际使用来检验。

KDDI Research 作为外部团队,选择基于 DM0.5 做后训练,并最终在 RoboChallenge Table 30 V2 上拿到榜首,至少说明一件事:这个开源底座具备被第三方继续开发的空间。

对一个开源具身模型来说,这一点很重要。

模型开源之后,真正的检验不是下载量,也不是发布时展示了多少 demo,而是其他团队能不能拿它接入自己的数据、训练流程和决策策略,并做出新的结果。

当然,VLA-DM0.5 的最终成绩不能完全归功于 DM0.5。KDDI 在多模型融合、后训练和决策优化上的工作,同样是这次登顶的关键。

更准确地说,DM0.5 提供了一个可用的起点,KDDI 则验证了这个起点还能继续往上走。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询