RPent 开源:让通用大模型真正驱动机器人完成开放世界任务

0 阅读

机器人终于开始“动脑”了

过去几年,大模型在文本、图像甚至代码生成上表现惊人,但一到物理世界就容易“翻车”。不是模型不够聪明,而是现实世界太复杂——光线变化、物体遮挡、机械延迟、抓取失败……这些都不是靠“想明白”就能解决的。

文章配图

最近,由清华大学、无问芯穹和正行创新联合推出的 RPent 开源框架,试图回答一个关键问题:通用大模型能不能真正成为机器人的“大脑”,让它在开放环境中完成没见过的任务?

文章配图

答案不是简单地把大模型接到机械臂上。RPent 的思路更务实:别指望一个模型干所有事,而是让不同模型各司其职,再通过一套基础设施把它们串起来。

文章配图

从“会动”到“会做事”:真机演示说了什么

文章配图

RPent 同步发布了多个真机 demo,没有炫技,全是日常场景里的开放式任务。比如“把干净餐具放进纸箱”——听起来简单,但对机器人来说,这意味着要重新理解“干净”“纸箱”和“放入”之间的关系。

传统做法是为每个任务单独训练策略。但 RPent 的机器人面对新指令时,会先观察环境:桌上有哪些容器?哪些是纸箱?盘子是否干净?然后才决定放哪里。

更关键的是,它会检查自己有没有做对。如果视觉定位偏差导致盘子差点放进金属篮,系统会暂停、重新识别目标,再调整手部位置。这不是预设的容错逻辑,而是基于当前状态的实时判断。

另一个例子是分拣饮料。机器人需要读取瓶身和袋子上的品牌标签,把可乐放可乐袋,雪碧放雪碧袋。抓起瓶子后,它会先轻微抬起测试夹持是否稳固;如果路径被挡住,就转动腕部绕开障碍。整个过程没有固定轨迹,全是根据实时感知动态调整。

面对被碗盖住的勺子,它也不会硬抓。而是先移开两个碗,让勺子暴露出来,再执行抓取。这已经不是“执行动作”,而是“解决问题”。

技能复用:把一次成功变成下次的起点

RPent 最有意思的设计之一,是 任务卡(Task Card) 机制。

当机器人第一次成功完成一个复杂任务——比如“拿起杯子、倾斜倒出钢珠、放回原位”——RPent 会把整个决策和执行逻辑记录下来,形成一张任务卡。下次遇到类似需求,系统可以启用 Flash Mode,直接复用这张卡,只根据当前视觉状态微调动作细节。

这样做的好处很明显:避免每一步都调用大模型,大幅降低延迟。实测中,端到端任务完成速度提升了 7 倍以上。

更重要的是,这种机制让机器人具备了“举一反三”的能力。比如,原本用于“拿容器”的技能,可以被重新组合成“倾倒”动作;抓取、双臂协同和持续接触控制结合起来,就能完成“持盘—擦拭—收纳”这一连串操作。

RPent 关心的不是“又学会几个动作”,而是“面对训练分布之外的新任务,能否调用已有能力拼出解决方案”。

分工协作:让模型干自己最擅长的事

RPent 没有试图造一个“全能模型”。相反,它把具身智能拆解成几个层次,让不同组件专注各自强项:

  • 通用大模型:负责理解自然语言指令,拆解任务目标,制定高层计划。比如“把干净餐具放进纸箱”会被分解为“识别干净餐具→找到纸箱→逐个放置”。
  • 专家模型(如 VLA、WAM):负责具体动作执行。VLA 擅长视觉-语言-动作对齐,WAM 则在手腕姿态控制上更精细。
  • 记忆系统:存储成功经验(任务卡)、失败案例和环境特征,供后续任务参考。
  • 执行框架:连接模型、工具和机器人硬件,确保感知、决策、执行、反馈形成闭环。

这套架构的核心,是 “观察—规划—执行—反馈—再规划” 的循环。机器人不再是一次性执行指令,而是在与环境的持续交互中学习和适应。

在真实基准上跑出了 92.6% 的成功率

RPent 在 LIBERO-PRO 基准上进行了测试。这个基准模拟了家庭和办公环境中的多样化任务,包含大量未见过的物体组合和空间布局。

结果是 92.6% 的任务成功率。这个数字的意义在于,它证明了“通用模型+专家执行+记忆复用”的路径,在真实物理环境中是可行的。

当然,RPent 还不是万能的。它依赖高质量的专家模型,对硬件响应速度也有要求。但在当前技术条件下,它提供了一种务实的中间路线:不追求端到端的大模型控制,而是构建一个能让大模型真正落地的基础设施。

具身智能的下一步:基础设施重构

RPent 的开源,不只是发布一个框架,更是在提示一个趋势:当大模型走向物理世界,我们需要重新思考“智能体”的形态。

过去,机器人系统往往是封闭的、任务专用的。现在,RPent 展示了一种可能:一个开放的、可扩展的、能持续积累经验的智能体架构。 它像操作系统一样,让大模型、专家模型、记忆模块和硬件接口协同工作。

这种思路或许比“造一个超级机器人模型”更接近实用。毕竟,人类也不是靠一个“大脑模型”搞定一切——我们有视觉系统、运动皮层、小脑协调,还有长期记忆和即时反馈。

RPent 正在尝试在机器人体内重建这种分工与协作。

项目已在 GitHub 开源:https://github.com/RLinf/RPent。对于关注具身智能落地的研究者和工程师来说,这可能是目前最接近“真实世界可用”的开源方案之一。