具身智能真实测评:最强模型仅12.8分,人类满分背后的鸿沟何在
跨越“死亡之谷”:具身智能评测的新标尺
通用操作机器人的发展轨迹,正经历从“视觉奇观”向“工程可靠性”的残酷转折。过去一年,视觉-语言-动作(VLA)模型、机器人基础模型及世界模型等技术概念轮番登场,展示了叠碗、倒水、整理桌面等令人印象深刻的演示效果。然而,演示视频中的丝滑表现往往掩盖了底层逻辑的脆弱性。当这些模型走出封闭的仿真环境,面对充满物理不确定性的真实世界时,其鲁棒性遭遇了严峻考验。
在此背景下,RoboDojo基准测试的发布具有里程碑意义。作为曾推出RoboTwin系列的同一核心团队带来的新作,RoboDojo构建了一个涵盖42个仿真任务与18个真实机器人任务的统一评测框架。这一框架不仅是对现有模型能力的全面体检,更是为具身智能领域树立了一座衡量“真实能力”的珠峰。评测结果显示,尽管算法迭代迅速,但当前最强模型在真实世界任务中的平均成功率仅为12.8%,而人类专家在同等条件下的成功率为100%。这一巨大差距清晰地表明,具身智能尚未跨越从仿真到现实的“死亡之谷”,行业亟需一套标准化、可复现且具备高区分度的评价体系。
任务设计的复杂性:为何这是一座“珠峰”
RoboDojo的设计初衷并非简单堆砌任务数量,而是旨在解构机器人操作中的核心能力维度。与传统benchmark仅关注Pick-and-Place(抓取与放置)不同,RoboDojo将挑战分解为五个关键能力域:泛化、记忆、精细操作、长程执行及开放语义理解。
在泛化能力测试中,机器人需适应动态变化的背景、光照、物体外观及复杂杂乱场景。例如,桌面上随机散布多达25个杂物,要求模型在高度非结构化环境中识别目标并执行操作。这种设置直接模拟了家庭或服务场景中无处不在的无序性。
记忆能力的考察则侧重于信息的时序整合。机器人需记住传送带上短暂出现后消失的物体特征,并在后续多候选对象中准确匹配目标。这要求模型不仅具备强大的视觉感知能力,还需在动作执行过程中维持内部状态的连贯性,避免“遗忘”关键约束条件。
精细操作任务对容错率提出了极致要求。插管、对齐及精确接触等动作,要求机械臂末端执行器在毫米级精度下完成交互。任何微小的角度偏差或位置误差均可能导致任务失败,这暴露了当前模型在微观物理交互控制上的不足。
长程执行任务则模拟了真实的家务流程,如拿起、移动、交接、对齐、放置等连续步骤。此类任务的核心难点在于误差累积。每一步的微小偏差都会在后续步骤中被放大,最终导致任务彻底失败。这与纯数字领域的错误容忍度形成鲜明对比,在物理世界中,差之毫厘即意味着谬以千里。
开放语义理解任务进一步测试模型对未见指令的泛化能力。即便最强模型在此类任务中的成功率也仅为1.67%左右。这意味着,虽然模型能在训练数据分布内表现良好,但面对全新的语义组合时,其从语言到动作的映射链路依然极其脆弱。
真实世界评测的标准化革命
RoboDojo最具颠覆性的贡献在于其真实世界评测部分(RoboDojo-RealEval)。长期以来,机器人领域的评测多依赖非标准化的Demo视频,缺乏可复现性和公平性。RoboDojo通过标准化流程,将真实机器人操作转化为可量化、可比较的科学实验。
该评测覆盖了ARX X5、Piper及Piper X三种主流双臂机器人平台,每个平台配置6个专属任务。任务内容涵盖盖积木、制作食物、装水果、插充电器、叠碗及清扫积木等日常场景。这些任务并非仿真环境的简单复刻,而是专门针对真实物理特性设计,旨在考察机器人在面对物体滑动、夹爪不稳、机械臂延迟及相机噪声等真实干扰时的表现。
为确保评测的严谨性,RoboDojo实施了严格的标准化协议。所有测试均在统一的硬件配置、工作空间布局及光照条件下进行。每次测试前,评测人员需根据预设布局复现场景;每个 Trial 均由三名评审进行双盲打分,既评估最终结果,也审视中间步骤的规范性。这种机制有效消除了主观偏见,确保了数据的客观性。
此外,RoboDojo强调“一次接入,多处评测”的便捷性。通过XPolicyLab这一统一接入层,研究者可以将不同模型的数据格式、预处理流程及部署环境标准化,从而在仿真与真机环境中无缝切换。这种基础设施的构建,极大地降低了模型迭代的工程成本,加速了算法从实验室走向应用的进程。
榜单背后的能力断层与行业启示
RoboDojo的公开排行榜揭示了当前具身智能模型的能力断层。在仿真环境中,表现最佳的模型Hy-Embodied-0.5-VLA平均分仅为13.07,平均成功率8.80%。而在真实世界中,头部模型π0.5的平均成功率也仅提升至12.8%。更关键的是,没有任何一个模型在五大能力维度上实现全能领先。
这一现象反映了具身智能发展的阶段性特征:模型在特定任务上的模仿能力显著提升,但在鲁棒性、泛化性及可靠性上仍存在短板。许多模型能够完成部分步骤,却在最后的关键环节失败,如在插管任务中因细微偏差而卡壳,或在长程任务中因误差累积而崩溃。
仿真与真实世界表现的不一致也值得深思。仿真环境往往假设完美的物理交互,忽略了接触力学中的非线性因素及传感器噪声。因此,仿真中表现优异的模型,在部署到真实机器人时可能因无法处理不确定性而迅速失准。RoboDojo的真实世界榜单数据证实了这一点,头部梯队模型的整体成功率仍处于低位,表明“Sim2Real”(仿真到现实)的技术瓶颈尚未完全突破。
这一结果对行业具有强烈的警示意义:通用机器人的到来不能仅依赖演示效果,必须建立在可量化、可复现的可靠性能之上。RoboDojo提供的“海拔尺”迫使研究界正视差距,从追求“酷”转向追求“稳”。
基础设施赋能:可持续演进的评测生态
RoboDojo的价值不仅在于提供了一份成绩单,更在于构建了一套可持续演进的评测生态系统。其异构并行仿真技术允许不同任务、物体及布局同时运行,大幅提升了大规模评测的效率。相比传统仿真仅复制场景并修改初始位置的简单并行,这种多维度的并行策略更能全面覆盖状态空间。
XPolicyLab作为背后的技术支撑,解决了机器人策略评测中的工程孤岛问题。通过提供统一的数据转换、训练模板及部署脚本,XPolicyLab使得30个代表性模型能够公平同台竞技。这种标准化接口不仅降低了研究者的接入成本,也促进了不同算法之间的横向对比与借鉴。
展望未来,RoboDojo团队计划扩展灵巧操作、移动操作、触觉操作及人型全身操作等评测维度。这将进一步丰富具身智能的能力图谱,推动技术向更复杂、更贴近人类操作能力的方向演进。
具身智能正处于从“量变”到“质变”的关键临界点。RoboDojo的建立标志着行业开始从碎片化的Demo驱动转向系统化的能力验证。虽然当前模型距离真正通用的操作机器人仍有显著差距,但通过标准化评测暴露问题、定位短板、指导优化,这条攀登珠峰之路正变得愈发清晰。对于整个行业而言,建立可信的评测基准,不仅是技术的需要,更是推动具身智能从实验室走向规模化商业落地的必经之路。