异步执行下的在线强化学习:SmoothRL如何解决机器人动作‘对错账’问题?
近年来,随着视觉-语言-动作(VLA)模型和世界动作模型(World-Action Model)的兴起,机器人控制正逐步迈向大模型驱动的新范式。这类模型通常以“动作块”(action chunk)的形式一次性生成未来一段时间的动作序列,从而减少频繁调用带来的延迟。然而,这一设计在真实机器人部署中面临一个根本性矛盾:机器人不能等待模型完成推理后再行动。
尤其在高速动态任务中,如投掷、击打或快速抓取,任何毫秒级的停顿都可能导致动能损失、轨迹偏移甚至任务彻底失败。因此,工业界和学术界普遍采用异步推理机制:机器人持续执行当前动作,而模型在后台并行计算下一组指令。简言之,“手上做A,模型已在算B”。
这种看似合理的工程实践,却给在线强化学习(Online Reinforcement Learning, Online RL)带来了新的理论挑战——模型“计划过”的动作,与机器人“真正做过”的动作不再一一对应。如果强化学习仍以整段动作块为单位进行优化,就会导致奖励分配失真:未被执行的动作可能因任务成功而被错误强化,或因失败而被误伤。这种“对错账”现象严重削弱了学习效率与策略稳定性。
针对这一问题,星尘智能(Astribot)基座模型团队提出了 SmoothRL(Online Reinforcement Learning During Asynchronous Execution) 框架,首次在真实高动态机器人任务中系统性地解决了异步执行下的在线学习难题。
动作块的三重身份:已提交、执行与丢弃
SmoothRL的核心洞察在于:并非所有生成的动作都具有同等的学习价值。在异步执行流中,一个动作块(例如包含32帧的动作序列)会经历不同的命运。团队将其划分为三个逻辑区域:
- 已提交区域(Committed Region):这部分动作由上一轮推理生成,已被发送至执行器,无法更改,必然会被执行。
- 执行区域(Execution Region):当前轮次新生成的动作中,实际会被机器人执行的部分。这是唯一与环境发生真实交互的片段。
- 丢弃区域(Discarded Region):虽由当前模型生成,但尚未执行即被下一轮推理结果覆盖,最终不会进入物理世界。
传统在线RL往往将整个动作块视为一个整体进行策略更新,忽略了上述时间异步性带来的执行偏差。SmoothRL则明确主张:只对Execution Region进行梯度反传。这意味着价值函数和策略网络的更新仅基于机器人真正经历的动作与状态转移,从而确保学习信号与物理现实严格对齐。
训练即部署:Reinforce in Deployment 原则
更进一步,SmoothRL不仅在损失函数层面区分动作区域,还在训练流程中复现真实的异步执行节奏。具体而言,在rollout收集阶段,模型推理与机器人执行完全并行:策略网络以固定频率(如5 Hz)生成新动作块,而机器人以更高频率(如30 Hz)执行动作。回放缓冲区(replay buffer)记录的轨迹天然包含动作块切换、部分覆盖和时间偏移等真实部署特征。
团队将这一设计理念概括为 “Reinforce in Deployment” ——不在理想化的同步仿真中训练,而是让学习过程直接暴露于部署时的真实动态。这种端到端的时间一致性,极大提升了策略从训练到部署的迁移能力。
在技术实现上,SmoothRL以微调后的基础策略π₀.₅为起点,沿用RLT(Residual Learning for Tasks)的轻量架构,采用TD3风格的actor-critic框架,在原始动作空间中预测残差修正(residual correction)。这种设计既保留了预训练策略的泛化能力,又允许在线学习聚焦于局部精细化调整。
真机验证:从高速投掷到毫米级插入
为验证SmoothRL的有效性,团队在星尘智能自研的绳驱机器人S1上开展了三项极具挑战的真实任务,覆盖两类典型场景:高动态连续操作与高精度双臂协同。
1. 动态投掷任务:成功率从39%跃升至94%
该任务要求机器人从随机位置抓取物体,并将其精准投入不同距离的目标箱。关键难点在于:投掷不是静态到达目标位姿,而是需要在摆臂过程中持续加速,并在精确时刻释放。一旦在动作块边界处出现停顿,手臂速度可能骤降至接近零,后续摆动难以重建所需动能。
实验表明,基础策略虽能完成基本抓取与挥臂,但释放时机与速度调节存在系统性偏差。经过250个在线rollout episodes后,SmoothRL将成功率从39%大幅提升至94%。更重要的是,末端执行器的加速度均方根下降52%,急动度(Jerk)降低47%,动作显著更平滑、连续。
2. 给笔戴帽:8% → 83%
此任务要求双臂协同,将笔尖精准插入仅5mm容差的笔帽孔中。基础策略通常能将笔移动至目标附近,但对不同笔帽位置的微小变化适应不足,常因角度或深度偏差导致失败。SmoothRL通过在线学习,有效修正了这些细微偏差,最终成功率提升超十倍。失败样本也从大幅错位转变为成功位置附近的小幅偏移。
3. 快递开箱:30% → 90%,学习曲线非单调
机器人需用约1mm宽的刀片插入2–3mm宽的箱盖接缝,并沿缝切开胶带。基础策略存在稳定左偏倾向。值得注意的是,其学习过程并非单调上升:在150个episodes时,成功率一度从30%跌至20%,随后反弹至40%,最终达到90%。这揭示了真实在线探索的复杂性——失败是学习的一部分,而非异常。
从“会不会”到“准不准”:机器人后训练的新范式
SmoothRL的意义远不止于算法改进。它标志着机器人学习范式的演进:预训练解决“会不会”,在线后训练解决“准不准、稳不稳”。
过去几年,机器人基础模型通过海量数据和强大架构,显著扩展了能力边界。但真实世界的问题往往不是“完全不会”,而是“差几毫米”、“慢半拍”或“换物体就不稳”。SmoothRL正是针对这类部署后问题设计的高效修正机制。
当前版本采用稀疏的成功/失败奖励,且允许操作员在必要时介入。介入动作可直接纳入训练数据,形成人机协同的在线优化闭环。尽管尚未实现完全自主进化,但已为真实场景提供了实用的后训练路径。
当然,SmoothRL也有其边界。它依赖预设的延迟预算(latency budget),且残差策略的表达能力受限于冻结的基础模型。若基础策略与目标行为差距过大,局部修正难以弥补全局缺陷。未来工作将探索更大范围的策略更新、更广的任务分布,以及异步执行与生成式策略的端到端联合优化。
动作作为“第一公民模态”:星尘的长期技术主线
SmoothRL并非孤立创新,而是植根于星尘智能对机器人智能本质的深层思考。团队始终认为:动作不应是视觉或语言模型的附属输出,而应成为机器人智能中的“第一公民模态”。
从Lumo-1的显式动作推理,到Lumo-2预测动作引发的世界状态变化,再到如今SmoothRL对动作执行真实性的严格建模,这条主线一以贯之——机器人存在的意义不是看懂世界,而是在物理世界中正确行动。
在此理念下,星尘已构建起完整的模型布局:前端Agent负责任务理解与能力调度,中间基座模型提供开放场景下的通用操作能力,后端RL机制则通过真实反馈持续修正策略。配合“AI模型-具身OS-绳驱本体”的全栈系统,推动Physical AI从实验室走向规模化应用。
SmoothRL的出现,不仅解决了异步执行下的学习对齐问题,更清晰地勾勒出机器人智能演进的下一阶段:在真实世界中持续学习、持续进化,让每一次动作都更接近物理规律与任务目标的完美契合。