具身智能新突破:'做个人吧'模型如何实现类人自进化?
近期,一段长达十分钟的一镜到底视频在具身智能圈内引发轰动。视频中的人形机器人在复杂干扰下稳定完成多任务操作,动作流畅、逻辑严密,甚至展现出类似人类的“偷懒”策略。更令人惊讶的是,该团队并未高调宣布成果,而是以连续释放多个粗糙但真实的Demo作为回应——这种“让模型自己说话”的姿态,反而激起了更广泛的技术好奇与行业震动。

这些视频背后的模型代号为“MVP”(Make Veritable People),中文戏称为“做个人吧”。这一命名并非调侃,而是对其核心目标的精准概括:赋予机器人接近人类的认知结构与行为逻辑。从已公开的四个Demo来看,该模型似乎正在突破当前具身智能的三大瓶颈:物理世界理解不足、泛化能力有限、缺乏持续进化机制。
物理世界的“直觉”:超越模仿的动作生成
第一个Demo聚焦于极端动态干扰下的手眼协调能力。当人类用木棍突然推搡机器人持水杯的左臂时,它不仅迅速调整姿态避免洒水,还在同一时间用右手扶住被推倒的易拉罐。这一行为的关键在于同时处理多重物理约束:水的晃动惯性、易拉罐的倾覆力矩、手臂关节的动力学限制。
传统视觉-语言-动作(VLA)模型在此类场景中往往失效。原因在于,它们依赖大规模动作数据的统计拟合,本质上是“看图说话”式的动作复制,缺乏对接触力、摩擦系数、质量分布等物理参数的显式建模。而“做个人吧”模型的表现暗示其内部可能整合了一个可微分的物理引擎或隐式动力学预测模块。这使得机器人能在毫秒级时间内预判外力扰动对系统状态的影响,并生成满足动力学可行性的补偿轨迹。
值得注意的是,机器人的反应并非预设脚本。在易拉罐被推动的瞬间,其左臂尚未完全恢复平衡,右臂却已启动扶正动作——这表明系统具备并行状态估计与多肢体协同规划能力。这种能力在人类中源于小脑与运动皮层的紧密耦合,而在机器人中实现,则需要将感知、预测与控制深度集成于统一架构中。
Zero-shot泛化:从“死记硬背”到“举一反三”
第二个Demo展示了机器人在未见过的家居环境中完成整理任务。它将玩偶归位、挂起帽子与健身环、抛掷坐垫至沙发,整个过程未经特定任务训练。团队声称其zero-shot成功率达80%,若属实,这将远超当前SOTA水平。
主流方法如RT-2或OpenVLA虽能通过大规模互联网数据提升泛化性,但在面对物体功能属性(affordance)时仍显笨拙。例如,它们可能知道“帽子可挂”,但无法判断挂钩高度是否匹配;或知道“坐垫可坐”,却不懂得在光滑地板上直接抛掷比弯腰放置更高效。
“做个人吧”模型的突破点在于将物体属性、空间关系与人类习惯编码为可组合的语义-物理联合表征。例如,系统可能学习到“环状物+垂直杆=可悬挂”、“柔性平面物+软质表面=可抛掷展开”等规则。这些规则并非硬编码,而是从海量人类操作视频中蒸馏出的概率性常识。更重要的是,模型能根据当前身体构型(如手臂长度、重心位置)动态调整执行策略——这正是“偷懒”行为的来源:在保证任务完成的前提下,选择能耗最低的动作序列。
这种能力的背后,或许是一种层次化任务分解机制:高层规划器基于语义理解生成子目标(如“挂帽子”),底层控制器则结合实时物理反馈优化动作细节(如手指开合角度、施力大小)。两者通过共享的状态表征实现无缝衔接,从而避免传统pipeline架构中的误差累积问题。
跨本体协作:一脑多形的具身泛化
第三个Demo引入两台异构机器人协同抖平床单。高个机器人负责抖动,矮个机器人负责拉伸,动作节奏高度同步。团队透露,二者共享同一套模型,仅通过本体参数适配实现行为分化。
这触及具身智能的核心难题:如何实现“一脑多形”(one brain, multiple bodies)?传统强化学习方法需为每种机器人单独训练策略,成本高昂且难以迁移。而此处展示的协作模式表明,MVP模型可能采用了本体无关的中间表征(body-agnostic representation)。例如,将任务描述为“在床单四角施加对称张力”,再由各机器人根据自身关节数量、臂展范围等参数实例化具体动作。
更关键的是,协作逻辑本身具有人类特征:矮机器人先跨步拉紧,高机器人再抖动——这与人类两人配合晾晒衣物的流程一致。这意味着模型不仅学习了物理交互,还内化了社会性行为规范。这种规范可能源于对人类协作视频中时序模式的建模,例如通过对比学习捕捉“等待-响应”行为对。
此类能力对服务机器人商业化至关重要。未来家庭可能拥有多种形态的机器人(轮式、双足、机械臂),若能共享同一智能核心,将极大降低部署与维护成本。
能量驱动的自主意图:从被动执行到主动优化
第四个Demo中,机器人一次性收纳四件物品:围巾搭颈、圆环绕臂、拖鞋耳机手持。这种“多负载整合”策略显著减少往返次数,体现出明确的能量效率意识。
当前大多数机器人仍处于“指令-执行”模式,缺乏对任务全局的优化视角。而MVP模型的行为暗示其决策过程受内在效用函数驱动,该函数可能包含能耗、时间、稳定性等多个维度。系统在规划时会评估不同方案的综合成本,并选择帕累托最优解。
有趣的是,机器人对不同物品采用差异化处理:围巾柔软可悬挂,故搭于颈部;圆环有孔洞,故绕臂滑落;拖鞋需防掉落,故用手紧握。这表明模型建立了物品-身体接口的映射知识库,并能动态组合已有技能。这种能力接近人类的“工具使用”认知——将自身身体部分视为可扩展的操作平台。
从技术角度看,这可能依赖于一种可微分的任务图规划器(differentiable task graph planner)。该规划器将长程任务分解为子任务节点,并通过梯度下降优化节点间的执行顺序与资源分配。由于整个流程可微,模型能端到端学习从感知输入到动作输出的映射,避免传统符号规划器的离散性缺陷。
技术路线猜想:统一架构下的认知闭环
综合四个Demo,可推测MVP模型采用了一种感知-预测-决策-执行一体化架构。其核心创新可能包括:
统一状态表征:将视觉、本体感觉、物体属性等信息编码为高维向量,该向量同时支持物理预测(如未来500ms的物体轨迹)与语义推理(如“此物可挂”)。
自回归动作生成:动作序列并非一次性输出,而是基于当前状态与历史动作逐步生成,每一步都经过物理可行性校验。
在线自进化机制:通过在线收集真实交互数据,持续微调动力学模型与常识知识库,形成“实践-反思-改进”闭环。
能量感知奖励函数:在强化学习框架中,奖励不仅来自任务完成度,还包括动作平滑性、关节力矩积分等能耗指标。
这种架构与当前主流的“大模型+小脑”分离式设计形成鲜明对比。后者通常将高层决策交给LLM,底层控制交给专用策略网络,两者间存在语义鸿沟。而MVP模型似乎将认知与控制深度融合,使机器人真正具备“边想边做”的能力。
行业影响与未来挑战
若MVP模型的技术细节得到验证,其影响将是颠覆性的。首先,它可能终结“遥操质疑”——当机器人能在开放环境中持续自进化,远程操控的成本将远高于自主系统。其次,zero-shot高成功率将大幅降低机器人部署门槛,推动家用服务机器人从“玩具”走向“工具”。
然而,挑战依然存在。视频中的场景仍属半结构化环境,真实家庭的杂乱程度远超演示内容。此外,模型对罕见物体(如不规则手工制品)的处理能力尚未验证。更重要的是,安全边界与伦理约束如何嵌入此类高度自主的系统,仍是悬而未决的问题。
团队宣称即将进行“开放环境街头测试”,这将是真正的压力测试。街道上的动态障碍、不可预测的人类行为、极端光照条件,都将考验模型的鲁棒性。若能通过此关,具身智能或将真正迈入实用化阶段。
无论如何,这些Demo传递了一个清晰信号:具身智能的竞争焦点正从“能否完成任务”转向“如何像人一样完成任务”。当机器人开始理解物理直觉、总结人类习惯、优化自身能耗,甚至发展出独特“性格”,我们或许正在见证智能体从工具向伙伴的蜕变。