芝诺发布 Zeno-1:首个去中心化多机器人协作基础模型
单打独斗不够用,机器人也得学会搭伙干活
过去几年,具身智能的发展重心大多放在“单体能力”上:更灵巧的手、更强的泛化、更稳的执行。但现实中的任务,很少是为一台机器人量身定制的。哪怕是最简单的家务,比如给枕头装真空袋,也需要多个动作点、连续判断和精细配合。

于是问题来了:如果把两台甚至更多机器人放在一起,它们是能像两个靠谱同事一样默契配合,还是各自为政、互相干扰,甚至在桌前“抢杯子”?

芝诺机器人最近发布的 Zeno-1,试图回答这个问题。它是一个 3B 参数的基础模型,也是第一个专为去中心化多机器人协作设计的物理智能模型。每台机器人运行的是同一个策略的副本,仅靠自己的视觉和本体感知做决策,却能在没有人类指挥、没有统一调度的情况下,自然地拆分任务、接力操作、协同完成。

从挂裤子到封装真空袋,演示视频里两个机器人配合得相当流畅——夹取、传递、扶袋、密封、抽气,一气呵成。中间任何一环出错,整个任务都会失败。而它们做到了。

这背后不是靠预设脚本,也不是靠中央大脑分配任务,而是模型自己“长”出了协作能力。

四阶段训练:从看世界到真协作
Zeno-1 的核心挑战很直接:怎么让一个模型在不知道队友在想什么的情况下,学会跟它配合?
这事儿难在哪?首先,两台机器人的联合状态空间会爆炸式增长;其次,协作是连续实时的,0.1 秒的时序偏差积累几秒后就可能让任务崩盘;最后,真实搭档不会完美执行预设轨迹——它可能犹豫、打滑、误判,模型必须对这些不确定性保持鲁棒。
为了解决这些问题,Zeno-1 采用了四阶段递进训练。
第一阶段:先当个“旁观者”,学物理常识
模型在大规模真实世界视频上进行预训练,学习物体如何受力移动、接触时发生什么、柔性材料怎么形变、液体如何流动。这一步不涉及控制,纯粹是建立对物理世界的通用先验。
有了这些常识,模型就不需要从零开始理解“用力过猛会推翻东西”或“松手物体会掉”。这些直觉被编码进网络,成为后续决策的基础。
第二阶段:落地到自家身体,练单兵能力
光有常识不够,还得会动。第二阶段让单台机器人在真实环境中训练,把视觉-物理先验转化为具体的感知-决策-执行链路。模型学会从自己的摄像头和关节状态中提取信息,并输出连贯的全身动作序列。
经过这一阶段,Zeno-1 作为单体已经能完成灵巧操作、工具使用和移动交互。用团队的话说:“先成为一个称职的个体,才有资格谈协作。”
第三阶段:核心创新——闭环伙伴交互(CPI)
传统多机器人训练依赖大量同步演示数据,但现实中很难让两台真机反复配合生成高质量数据。Zeno-1 走了另一条路:让两台正在学习的机器人互为训练伙伴。
每台机器人根据自己的观测独立行动,它的动作会改变共享环境,进而影响对方的下一步决策。搭档的行为天然带有噪声、延迟和失误——而这恰恰是训练所需的真实扰动。
在这个闭环中,协作行为自发涌现:减速、等待、让步、维持接触、重新校准时序。模型不是在模仿人类演示,而是在通过真正的协作来学习协作。
实验显示,即使人为引入会让同步策略失效的延迟,Zeno-1 仍能保持协调。这种鲁棒性正是 CPI 训练带来的直接结果。
第四阶段:哪里跌倒,就在哪里爬起来
部署过程中,系统会自动识别协作出错的关键时刻。操作员只需围绕这些片段提供少量纠正性演示,模型就会在这些高风险区域投入更多学习资源。
有趣的是,增加 CPI 数据比添加等量的同步演示数据更能提升协作性能。这说明,真实的交互反馈比完美的示范更有价值。
两个关键子系统:让长程协作成为可能
挂裤子可能几十秒搞定,但给枕头抽真空要好几分钟。要在这么长时间里保持协调,光靠反应式策略远远不够。Zeno-1 引入了两个子系统来支撑长程任务。
持久交互记忆:别做“金鱼脑”
这个可学习的记忆模块在每个时间步更新,压缩记录三类信息:任务进展到哪一步、搭档近期的行为趋势(是否在减速或调整策略)、共享物体的状态如何演变(比如袋子是否已封口、枕头是否完全入袋)。
消融实验证明,移除该模块后,模型在超过 3 分钟的任务上表现大幅退化。没有记忆的机器人就像金鱼,每一步都从零开始判断局势,无法利用已积累的上下文。
预测式内省:动手前先“想一想”
Zeno-1 在执行动作前会做两层预测。
第一层是对搭档的影响。一个动作局部看可能最优,但如果会让搭档陷入被动,整体就是次优的。测试数据显示,Zeno-1 在 87% 的协作决策点上选择了对搭档更友好的动作;移除该机制后,这一比例降到 61%。
第二层是物理接触的稳定性。模型内置了一个行动条件世界模型,能预测执行某个动作后物体状态会如何变化。在 200 次真实实验中,它能在接触发生前 0.5 秒预判抓取失败,AUC 达到 0.94,远高于仅依赖当前观测的 0.81。
简单说,它既能“为搭档着想”,又能“预判物理风险”,从而主动避免协作失误。
为什么坚持去中心化?
有人可能会问:既然协作这么难,为什么不干脆用中央控制器统一分工?芝诺选择去中心化,主要出于两个实际考量。
一是扩展性。中心化系统的联合动作空间随机器人数量指数级膨胀。假设每台机器人的动作维度是 d,N 台就是 d^N。而 Zeno-1 的架构下,新增一台机器人只需加载同一策略副本,计算量线性增长,无需重新设计控制器。
二是鲁棒性。中心化系统存在单点故障风险。一旦中央调度器延迟或宕机,整个团队瘫痪。而去中心化系统中,每台机器人独立运行,单点故障不会扩散。
这意味着用户可以按需逐台增加机器人,灵活应对产能变化,而不必一次性部署整套系统。
更重要的是,Zeno-1 把共享的物理世界本身当作协调接口。机器人通过观察环境和其他机器人的行为来判断任务状态,协调在真实交互中自然产生,而非依赖显式通信或预设协议。
协作智能,正在成为新共识
Zeno-1 并非孤例。学术界和产业界都在向这个方向靠拢。
今年 6 月,斯坦福 Chelsea Finn 和 Jeannette Bohg 团队提出了 CHORUS 方法,同样基于单一 VLA 策略实现去中心化多机器人协作。产业端,Figure 的 Helix 02 和 Google DeepMind 的 Gemini Robotics 2 也都明确将 multi-robot collaboration 列为核心能力。
一个趋势越来越清晰:机器人基础模型正从单体能力迈向协作智能。
单台机器人再强,能力终究有限。只有当它们真正学会观察彼此、理解彼此,并像人类同事一样共同工作,“1+1>2”才不是口号。而 Zeno-1 至少证明了一件事:这种协作能力,可以在一个去中心化的单一策略中实现。
未来或许不是由一台超级机器人主导,而是由一群能自主协作的普通机器人共同构建。