三台异构机器人接力完成pH实验,失败后自主修正而非重来

0 阅读

三台机器人接力,失败后没有从头再来

最近网上流传一段四分钟的视频:用户只输入一句自然语言指令——“利用现场材料,配制并核验六级 pH 彩虹”。随后,四足机器人、人形机器人和双臂机械臂依次登场,完成扫描、运输、交接与台面操作。整个过程没有人为分步遥控,三台构型迥异的设备共享同一个任务上下文。

图片

前五支试管顺利调出目标颜色后,第六支却偏了。这时系统没有把“动作执行完”当作任务结束,也没有粗暴地从头再来。它保留当前实验台状态,在原有流程中追加一次 PlanRevision:补充缓冲液、重新滴定、再次检测。直到 pH 实测值为 11.03,落入预设容差区间,任务才被正式标记为通过。

图片

这个细节暴露了传统机器人控制的盲区:夹爪闭合≠抓取成功,指令发送≠目标达成。而 PhyAgentOS 的设计逻辑是——任务是否完成,得靠证据说话。

文章配图

从“动作结束”到“任务完成”:验证与受控恢复

图片

PhyAgentOS 把执行事实、现场证据和任务结论拆开处理。Query、Action 和 Session 记录工具调用与执行状态;Evidence 模块则保存动作前后的图像、传感器读数和设备日志;最终由任务级 Verifier 综合目标定义、成功标准和证据时序,给出明确判断:success、failure,还是 replan required。

图片

当验证失败时,恢复行为仍属于原 AgentTask。系统不会新建任务或盲目重试,而是基于已有工具轨迹、证据链和最新环境状态,生成一次有界的 PlanRevision。视频中仅重做第六支试管,正是这种“局部修复”能力的体现。

图片

这种机制在基准测试中也显出价值。在 LIBERO 的 2000 个 Episode 中,X-VLA 策略首次成功率为 97.3%;PhyAgentOS 对其中 54 个失败样本进行分析与恢复,成功挽回 26 个,最终成功率提升至 98.6%。值得注意的是,系统未修改策略模型代码,也未将恢复过程记为新 Episode。在 CALVIN 长程任务和 RoboCasa365 场景中,完整链路分别带来最高 4.1 和 8.4 个百分点的性能增益。

图片

经验回流:只有闭环任务才能沉淀为能力

图片

验证不仅是任务终点,更是经验进入系统的门槛。PhyAgentOS 只将通过验证的完整任务整理为 TaskEpisode,包含目标、计划修订、工具轨迹、证据指纹和最终结论。那些缺乏证据支撑、中途中断或结果未知的执行记录,不会直接转化为新技能。

图片

这些 TaskEpisode 经过反思归因后,可能产出两类结果:稳定可复现的工作流晋升为 SkillCandidate;反复出现且可归因的问题则聚合为 Lesson。设备掉线、网络抖动或传感器噪声等环境异常,仅保留诊断信息,不进入经验库。

图片

候选经验正式生效前还需多任务佐证、结构校验与安全检查。系统会自动过滤具体坐标、临时设备 ID、凭据等敏感信息,并拦截任何试图绕过 Forge 或 Verifier 的指令,防止一次偶然成功污染已有能力。最终 Evolution 模块沉淀的不是原始日志,而是来源可追踪、条件可检查、能在后续任务中复用的经验。

图片

Forge:统一异构机器人的物理执行入口

现实中的机器人很少来自同一家厂商。仓库里,四足机器人擅长穿越狭窄通道,机械臂适合固定工位操作,人形机器人则能使用为人设计的按钮或工具。它们接口各异、软件环境不同,过去协同往往需要为每种设备单独开发脚本。

PhyAgentOS 的解法是 Forge——一个面向物理智能的通用控制底座。它用统一协议抽象机器人、传感器和环境,让上层 Agent 无需理解底层差异,只需调用标准化 Tool。Forge 负责能力发现、任务路由、指令下发和状态管理。

例如,门店系统下达“完成 A 区货架巡检与缺货复核”任务后,四足或轮式机器人负责移动和图像采集,视觉模块识别货架状态,机械臂在条件允许时执行补货。系统关注的是任务是否完成,而不是操作者是否切换了三套控制台。

v1.0.0 版本还重构了系统状态协议。AGENTS.md、SKILL.md 等 Markdown 文件继续承载面向人和 Agent 的可读知识;真实动作统一通过 Forge Tool API 执行;AgentTask、PlanRevision、Evidence 和验证结果则写入结构化事实记录。知识、执行与事实分层存放,系统不再靠轮询文件驱动物理动作。即使遇到超时或结果未知,也会先核对现场状态再决定后续,降低重复执行风险。

用 Tool 与 Skill 组合解决复杂长程任务

真实世界的工作很少是一个动作。巡检货架需要移动、识别、拍照、判断、复核;补货涉及确认商品、取货、避障、放置、检查排面;生产线换型更可能包含搬运、打开工装、上料、检测和异常处理。

PhyAgentOS 将这些拆解为可调用、可验证的 Tool。“移动至货架”“拍摄图像”“抓取物料”“复核结果”均可独立封装。经过多次验证的流程则沉淀为 Skill。这种组合方式让系统不必为每个复杂任务重写僵硬脚本。

面对“完成 B 区货架巡检并处理缺货商品”这类指令,系统可根据现场情况动态组合能力模块。若某步出现遮挡、错位或抓取失败,也能仅调整问题环节,而不让整个流程从头开始。这正是复杂长程任务走向实用的前提——机器人不需要记住全部流程,而是在目标约束下调用已验证能力,并根据反馈持续推进。

生态与产业落地:从 Demo 到稳定系统

PhyAgentOS 采用 MIT 协议开源,核心仓库已迁移至 PhyAgentOS-core。官方支持的机器人构型从 19 种扩展到 43 种,覆盖机械臂、四足、人形、移动操作平台和灵巧手,其中 9 种支持真机运行。接入一种新机器人通常只需 5 到 10 分钟;更换模型、仿真器或本体时,上层任务链路无需同步改写。

正式版提供 9 个算法节点,涵盖 VLA、世界模型、视觉感知和模仿学习,另有 11 个列入开发计划。最简安装只需克隆仓库,配置模型 Provider 后即可运行通用 Agent;驱动真机则需额外安装 Forge Skill、Runtime 与硬件依赖。

但开源系统发布不等于产业化完成。机器人本体可靠性、现场安全、部署成本、数据质量、网络条件,以及与既有业务系统的衔接,仍是具身智能落地的关键障碍。

行业竞争焦点正在转移:从“能否完成一次炫目的演示”,转向“能否在真实任务中稳定完成、验证结果、处理例外,并持续降低人工干预”。

在零售场景,闭店后的货架巡检是个典型用例。机器人沿通道移动,读取状态,发现缺货或错位后调用对应设备复核或补货。它不必一开始承担整店工作,但可在单一区域、一类商品、明确时间窗口内实现稳定闭环。

在工厂,生产线换型同样适用。移动机器人送物料,机械臂上料装配,视觉系统检查结果。一旦零件方向错误或装配不全,系统保留现场,仅返工出错环节,而非停掉整条产线重来。

作为主要研发方,X-Era Lab(拓元智慧)正将这套体系带入智慧零售、工业制造与人居服务等真实场景,让 Physical Agent 在持续运行中完成验证、经验回流与能力迭代,逐步从单点 Demo 演进为可长期部署、持续进化并规模化复制的系统能力。