机器人化学家上岗难在哪?中科大Labimus提出三维精度评测新范式
从二元成败到科学精度:重新定义机器人化学家的“及格线”
在传统机器人benchmark的语境下,成功往往被简化为一种二元状态:任务完成即为1分,失败则为0分。这种逻辑在搬运箱子或开关抽屉等离散操作中行之有效,但在精密化学实验室里却显得苍白无力。对于一位有机化学家而言,称量0.850克粉末时,上下误差不超过0.001克是基本要求;若机器人仅能将粉末倒入称量舟,却导致质量误差高达0.01克,这在工程上或许算作“操作完成”,但在科学上则意味着实验数据的作废与试剂的浪费。
这种巨大的认知偏差,正是中国科学技术大学联合北京人形机器人创新中心推出Labimus平台的初衷。作为一个专门针对精准化学实验室的人形灵巧操控仿真和评测平台,Labimus并未止步于展示机器人能否“做”动作,而是致力于解决机器人能否“做对”动作的核心痛点。它试图打破传统的二元评判标准,引入更严格、更精准、更有效的考题,为即将上岗的“机器人化学家”制定一套符合科学规律的严苛考核体系。
高保真重构:当仿真遇见真实物理属性
要让机器人接受科学实验层面的考核,首要任务是将化学实验室“搬”进仿真世界。然而,Labimus所做的远非简单构建一个3D模型。团队采用Real-to-Sim的方式,从真实有机化学实验室出发,重建了30余件实验室资产,包括分析天平、烧杯、量筒、圆底烧瓶及药匙等常见器材。但真正的技术难点在于赋予这些设备真实的物理属性,而非简单的视觉贴图。
以分析天平为例,其玻璃挡风门并非播放预录动画的静态道具,而是具有真实导轨滑动属性的交互对象。机器人必须像人类一样捏住把手,控制推拉力度,才能缓缓推开挡门。更复杂的挑战来自于粉末模拟。在多数机器人仿真平台中,可变形物体如液体和颗粒往往被简化为视觉特效。Labimus则采取更为硬核的物理建模方式,将每一粒粉末建模为独立的刚体,赋予其质量、碰撞等物理属性。当机器人舀起粉末时,颗粒随药匙运动;落入称量舟后,每一粒颗粒的质量会被实时累计到天平屏幕中,形成与现实中完全一致的称量反馈。
这种对物理细节的极致追求,使得仿真环境与真实世界之间的Sim2Real鸿沟大幅缩小。借助大语言模型,系统还能解析标准操作程序(SOP)文档,自动拆解出打开挡风门、关闭挡风门、抓取放置、按下去皮键、拾取工具、舀粉称量等六个原子操作,以及完整的七步固体称量工作流。这意味着,机器人面对的不再是工程师凭经验设计的测试用例,而是真实实验室中每日发生的标准化操作场景。
三级递进:破解“刷分”困局的新维度
有了真实的考场和考题,如何评分成为了关键。Labimus提出了一个核心观察:Task Success(任务完成)≠ Scientific Success(科学成功)。为此,平台设计了三级递进的评测层级,构成了一张3×4的评测矩阵,涵盖标准布局及光照、纹理等四种扰动条件,全面检验机器人策略的精度与鲁棒性。
第一层级关注基础任务完成情况,如门是否打开、物体是否被抓取。第二层级引入连续精度指标,例如称量误差是否满足SOP规定的±0.001克要求。第三层级则进一步考察长程表现,关注机器人在连续多步操作中是否保持精度,以及误差是在哪一步开始累积的。这种分层评估机制,能够揭示出上一级评测无法发现的深层失败原因。
在针对ACT、Diffusion Policy和π0三种代表性机器人学习方法的首批测试中,难度阶梯清晰可见。开门任务相对简单,ACT取得了56.7%的最高成功率;关门任务要求力度控制,π0表现最佳也仅为40.7%;而需要指尖精准瞬时接触的去皮键操作,对大多数方法构成了严峻挑战,ACT成功率仅2.0%,其他方法更是归零。
更值得关注的是精度差距的揭示。以ACT在抓取放置任务为例,按传统二元标准,其完成了5.3%的episode;但若应用Tier 2的精度标准,只有3.3%满足位置误差不超过15毫米的要求。换言之,在那些被视为“成功”的操作中,近四成其实是不达标的。此外,鲁棒性测试显示,单一环境扰动对策略影响有限,但光照与纹理扰动叠加时,成功率降幅远超线性叠加,揭示了真实世界复合环境变化对策略的非线性共振效应。
本体瓶颈:具身智能迈向科学的“最后一公里”
Labimus的评测结果揭示了一个严峻现实:精细的接触控制是当前机器人方法的共同短板。这也直接指向了具身智能发展的最大瓶颈——本体能力。
中科大人工智能与数据科学学院特任教授夏彦指出,虽然模型、数据和本体均存在瓶颈,但当下最突出的仍是本体能力。精密化学操作要求灵巧手具备高自由度、敏感力觉感知及毫秒级响应延迟。目前市场上能达到这一水平的灵巧手单价高达30万元以上,且大多未实现量产。这种硬件限制导致数据采集成本高昂,且因缺乏统一标准(视觉、触觉、UMI等采集方案百花齐放),数据迁移成本极高。
相比之下,特斯拉Optimus之所以进展迅速,很大程度上得益于其复用了自动驾驶统一的传感器规格,降低了数据获取与迁移的门槛。而学术界的研究往往各自为政,硬件协议与坐标系的不统一加剧了数据混乱,进一步限制了模型训练的效果。
“如果本体都完不成动作,收集再多数据也没用;没有好的数据,模型也训练不出来。”夏彦坦言。这种层层传导的困境,从本体能力延伸至数据收集,最终制约了模型性能的提升。Labimus选择在此时发布v0版本,旨在先占位、再完善,邀请更多领域专家加入,共同探索本体极限,推动数据采集标准的统一。
跨界融合:从工具替代到科学发现加速
Labimus的意义不仅在于提供一个评测工具,更在于倡导一种新的科研范式。在AI for Science(人工智能驱动的科学研究)领域,大模型正逐渐承担阅读文献、设计实验、预测性质等“动脑”工作,而机器人则负责移液、混合、加热等“动手”环节。然而,现有的自主实验室多为定制系统,机器人无法适应通用实验室环境。
人形机器人结合灵巧手的方案,被视为解决这一问题的终局路径。因为化学实验室本就是为人类双手设计的,人形机器人无需改造实验室布局,即可利用现有工具完成操作。这不仅避免了定制化硬件的高昂成本,也提升了系统的通用性与迁移能力。
展望未来,研究人员或许只需告知机器人“寻找一种新催化剂”的目标,大模型即可自动规划全流程,机器人负责执行并根据结果调整方案。虽然目前大模型生成的流程仍需人工校验,Sim2Real迁移尚未完全验证,但这一愿景为科学发现效率的提升提供了无限可能。
传统的benchmark竞争逻辑在于刷分,但在科学场景下,最终评价机器人科学家的标准不应仅是任务完成率,而是其是否真正加速了科学发现。例如,将新物质的发现时间从100年缩短至一周,这种效率维度的提升是现有评测体系所缺失的。
Labimus的提出,标志着具身智能正从单纯的动作执行向科学探索迈进。尽管前路仍面临本体硬件昂贵、数据标准缺失、跨学科沟通壁垒等挑战,但通过建立量化操作精度与衡量科研效率相结合的完整评价体系,行业有望在避免沦为“刷分工具”的同时,真正推动机器人化学家从概念走向现实。这是一场关于精度、鲁棒性与科学效率的综合大考,也是AI与化学深度融合的必由之路。