1.5B参数如何跑通具身智能?MiniCPM-Robot颠覆大模型依赖

1 阅读

轻量化浪潮下的具身智能新解法

在具身智能领域,一场关于模型规模的辩论正在悄然转向。长期以来,行业似乎陷入了一种“参数崇拜”,认为只有千亿级甚至万亿级参数的模型才能赋予机器人真正的智能。然而,面壁智能近期发布的MiniCPM-Robot系列模型,以仅1.5B的参数量,向市场证明了“小而精”在物理世界执行中的巨大潜力。这不仅仅是模型大小的缩减,更是对机器人核心痛点——实时性、记忆保持与环境适应力的一次精准打击。

此次开源的MiniCPM-Robot系列包含两大核心组件:负责精细操作的MiniCPM-RobotManip和专注于动态跟踪的MiniCPM-RobotTrack。配合专为Physical AI设计的开源推理框架PhyAI,这套组合拳旨在打通从云端算法到端侧执行的最后一公里。在WAIC(世界人工智能大会)上的演示中,1.5B参数模型展现出的稳定性与泛化能力,让业界重新审视了“规模即正义”的传统认知。

突破记忆瓶颈:从单帧感知到连续决策

很多主流VLA(视觉-语言-动作)模型在执行复杂任务时存在一个致命弱点:它们往往基于当前帧画面进行瞬时判断,缺乏对历史状态的有效记忆。例如,在让机器人连续按压按钮或层层叠加三明治的任务中,模型很容易因为“遗忘”之前的动作步骤而中断任务,或者陷入死循环。

MiniCPM-RobotManip的核心突破在于其引入的历史观测与动作记忆机制。不同于传统方法每帧独立计算,该模型将历史观测数据和已执行动作纳入判断依据。在专门考察上下文记忆的RMBench基准测试中,这一机制带来了质的飞跃。数据显示,当对标模型π0.5得分仅为10分(接近随机水平)时,MiniCPM-RobotManip取得了约53分的优异成绩。

这种“记忆力”的提升对真实场景至关重要。叠衣服、收拾桌面等日常任务虽然看似简单,实则包含严密的逻辑链条。只有能够记住“任务进行到哪一步”,机器人才能完整执行长程任务,避免中途“失忆”导致的动作僵硬或失败。

极致延迟优化:成本减半的速度竞赛

除了记得住,机器人还得反应快。在机械臂操作中,每增加一秒的等待时间,动作流畅度就会呈指数级下降,严重影响用户体验和作业效率。

在H100显卡、bf16精度下的单帧推理对比中,MiniCPM-RobotManip的决策延迟约为120毫秒,而π0.5约为234毫秒。前者几乎将后者的延迟缩短了一半。这种“成本减半”不仅体现在推理耗时上,更体现在计算量的显著降低。对于依赖实时反馈的机器人而言,能够在有限算力下快速输出下一步动作,其价值不亚于在基准测试中提高几个百分点。

与此同时,MiniCPM-RobotTrack在保持0.9B轻量参数的同时,也在多种真实场景中取得了优异表现。在单目标跟踪、多人干扰跟踪以及模糊指令跟踪(如“跟随穿黑衣服的人”)三项任务中,其追踪率分别达到89.8%、73.4%和80.4%。即便在与OpenTrackVLA和闭源模型TrackVLA++的对比中,它也在多个指标上实现了显著超越,特别是在模糊目标跟踪成功率上高出近17个百分点。

技术内核:视觉压缩与流式计算

MiniCPM-Robot能够以极小参数实现高性能,背后是面壁智能在视觉处理技术上的创新。机器人执行动作需处理多路摄像头画面、文字指令及输出动作,若每张图片都转换为大量视觉Token,随着任务进行,计算量将迅速爆炸。

为此,MiniCPM-RobotManip采用了“视觉Token压缩”策略。它智能识别并压缩桌面纹理、墙面图案等与任务无关的背景信息,仅保留关键内容。这种“去噪”处理大幅减少了单次推理的信息量,从而提升了速度。

更关键的是流式计算技术的应用。传统方法在处理新画面时需重新计算所有历史,导致任务越长,算力需求越高。MiniCPM-Robot采用流式架构,复用已处理的历史信息,新画面只需接续计算。这如同观看连续剧,无需每更新一集就重看前几季。这种机制使得机器人能以更低成本保留长程记忆,避免计算量随任务时长线性暴涨。

端侧部署与弱网生存:真实的落地能力

具身智能的最终检验场不在服务器,而在物理世界。在电梯、地下停车场等弱网甚至无网环境中,云端模型往往因信号中断而失效。MiniCPM-RobotTrack展示了其强大的本地部署能力。

该模型直接运行在宇树机器狗Go2 Edu的本体算力上,无需外接开发板或依赖云端服务器。在端到端响应延迟控制在180毫秒左右的条件下,即便拔掉网卡,机器狗仍能根据摄像头画面和文字指令,完成目标识别、持续跟踪和运动控制。这种“断网生存”能力,对于园区巡检、仓储物流等网络条件不可控的场景具有极高价值。

此外,面壁还搭建了自进化数据管线,解决长尾场景问题。针对目标突然横穿、快速转向、多人交叉遮挡等罕见但关键的场景,系统通过仿真与实机联合训练,收集错误样本,经专家策略纠偏后重新注入训练。这相当于为模型准备了一本“自动更新的错题本”,使其在真实世界中不断进化。

生态协同:PhyAI框架与行业落地

模型的先进性必须依托高效的工程框架才能转化为生产力。此次同步开源的PhyAI推理框架,由明体科技联合北京邮电大学、北京大学研发,旨在解决多模型适配难、部署成本高的问题。

在RTX 5090上,PhyAI相比官方仓库,对π0、π0.5和GR00T实现了约2.85倍、1.82倍和2.28倍的加速。针对MiniCPM-Robot系列,通过CUDA Graph和定制融合算子优化,在NVIDIA H20上帧率从10.12Hz提升至36.77Hz。这种底层优化确保了模型能在 diverse 的硬件平台上高效运行。

在应用层面,面壁已与乐聚机器人、吉利汽车等展开合作。在展厅导览场景中,机器人基于本地知识库完成离线讲解与避障;在仓储场景中,通过RoboHarness框架整合VLM规划与VLA执行,实现长程任务管理与异常恢复。这种“先通后专”的策略,即先构建具备物理常识的基础模型,再针对特定领域优化,正成为具身智能落地的主流路径。

结语:性价比定义下一轮竞争

具身智能行业的竞争焦点,正从单纯的参数规模比拼,转向单位算力带来的实际能力收益。1.5B和0.9B的模型,不仅意味着更低的训练与部署成本,更代表着更强的实时性与更好的端侧适应性。

当AI长出双手双脚,它需要的不仅是“聪明的大脑”,更是“敏捷的身手”和“经济的开销”。MiniCPM-Robot系列通过技术创新,在轻量化与高性能之间找到了平衡点,为机器人真正走进工厂、仓库和公共空间提供了切实可行的解决方案。未来,能够稳定、快速、廉价地解决真实问题的模型,将在新一轮行业洗牌中占据先机。