具身智能破局点:MiniCPM-Robot如何以1.5B参数重构机器人感知与决策?

0 阅读

边缘侧的算力革命:轻量级模型的具身化突破

具身智能(Embodied AI)的发展长期受限于一个核心矛盾:物理世界的实时响应需求与云端大模型高昂推理成本之间的鸿沟。传统的路径往往依赖于将复杂的感知-决策-控制回路放在云端或高性能边缘服务器上进行,这不可避免地引入了网络延迟,且在弱网或断网环境下生存能力极弱。

2026年7月19日,在世界人工智能大会(WAIC)上,面壁智能正式开源了MiniCPM-Robot系列模型。这一举措并非简单的参数堆砌,而是指向了一个更为务实的技术路线:通过极致的模型压缩与架构创新,让具备强大认知能力的AI直接在机器人本体上运行。MiniCPM-Robot系列包含两个核心模块,分别针对操作任务(Manip)和跟踪导航任务(Track),它们共同构成了一个轻量级、高性能且具备本地化部署能力的具身智能基座。

这一系列发布的最大亮点在于其“小尺寸、高性能”的特质。在算力日益成为稀缺资源的今天,如何让模型在资源受限的边缘设备上发挥最大效能,是具身智能走向千行万业的关键钥匙。

操作能力的跃升:1.5B参数背后的记忆魔法

在机器人操作领域,VLA(Vision-Language-Action)模型已成为主流架构。然而,现有的主流VLA模型,如π0.5或Qwen-VLA,通常需要3B至7B甚至更大的参数量,才能满足基本的操作稳定性要求。参数量的增加直接导致了推理时的显存占用和计算量的激增,这对于电池供电、散热受限的移动机器人而言是巨大的负担。

MiniCPM-RobotManip打破了这一常规。该模型基于面壁智能最新的MiniCPM-V 4.6多模态端侧模型训练而来,参数量仅为1.5B。令人惊讶的是,其综合性能在主流VLA基准测试中位列第一梯队,甚至超越了部分3-4B体量的模型。更关键的技术突破在于其对“上下文记忆”的处理方式。

传统的视觉动作模型大多基于单帧或极短窗口的反应式推理,这意味着机器人每次做出决策时,都像是在“失忆”状态下盲猜,难以处理需要长期逻辑连贯性的任务,如“先把红块盖住,再揭开蓝块”。MiniCPM-RobotManip引入了具身原生记忆机制,支持长达1分钟的上下文记忆窗口。在RMBench测试中,其得分达到53分,而主流竞品π0.5仅得10分(接近随机水平),这充分证明了其在复杂指令理解上的巨大优势。

流式推理:从125 TFLOPs到3.3 TFLOPs的效率奇迹

性能的提升往往伴随着算力的消耗,但MiniCPM-RobotManip通过技术优化实现了反直觉的效率跃迁。其核心秘密在于对视觉Token的极致压缩以及流式实时推理技术的应用。

在包含60帧历史观测的机器人操作任务中,传统重新计算方式在每个决策步需要消耗约125 TFLOPs的算力。而采用MiniCPM-RobotManip的流式推理机制后,这一数字骤降至3.3 TFLOPs。这一数据比π0.5在无历史帧输入下的5.0 TFLOPs还要低。

在H100 GPU、BF16精度环境下,MiniCPM-RobotManip的单决策步推理时延仅为120毫秒,相比π0.5的234毫秒降低了近一半。这种效率的提升并非通过牺牲精度换取,而是源于对模型内部数据流的精细重构。视觉信息的输入不再是每次从头计算,而是通过流式机制复用历史信息,大幅减少了冗余计算。

这种“低成本、高性能”的组合,使得在资源有限的嵌入式平台上部署具备长程记忆能力的VLA模型成为可能。对于工业巡检、仓储物流等需要长时间连续作业的场景,这意味着机器人可以在更小的硬件平台上实现更智能的操作逻辑,同时延长电池续航。

断网生存能力:本地化跟踪模型的实战价值

如果说操作能力是机器人的“手”,那么跟踪导航则是其“眼”。MiniCPM-RobotTrack是一款0.9B参数的端到端视觉指令跟踪模型,由面壁智能与南京大学联合研发。其核心创新点在于“本地化”与“断网部署”。

在复杂的动态环境中,目标可能被遮挡、发生快速移动或出现多目标交叉,这对跟踪算法提出了极高要求。MiniCPM-RobotTrack在单目标跟踪(STT)、动态多目标跟踪(DT)和模糊目标跟踪(AT)三项评测中,分别取得了89.8、73.4和80.4的追踪率,优于开源方案OmTrackVLA,并在模糊目标跟踪上大幅领先闭源模型TrackVLA++。

值得注意的是,该模型在仅0.9B参数且未进行下游强化学习优化的情况下,便取得了上述成果。这表明,通过高质量数据的端到端训练,轻量级模型完全可以在无需多视角输入的情况下,获得极具竞争力的真实场景指令追踪能力。

更具颠覆性的是其部署形态。MiniCPM-RobotTrack首次实现了在宇树Go2 Edu机器狗上,仅依靠原装摄像头和本地算力即可完成纯视觉的本地自主指令追踪。在真机实测中,模型在机器狗原生算力下稳定达到5+ Hz的帧率,端到端响应时延约为180毫秒。

这意味着,即使拔掉机器狗的网卡,切断所有外部网络连接,机器人依然能够依靠本地视觉画面与文本指令,持续完成目标识别、跟踪与运动控制。这种断网自主能力,对于楼宇巡检、园区安防乃至灾害救援等网络基础设施可能瘫痪的极端场景,具有不可替代的战略价值。

自进化数据管线:让模型在实践中“越用越强”

具身智能最大的痛点之一是数据采集成本高、长尾场景覆盖难。静态的训练集往往无法覆盖现实世界中无穷无尽的变化。为此,MiniCPM-RobotTrack构建了一套自进化数据管线。

这套管线的核心逻辑是“自动检测-人工复核-主动暴露-持续补充”。首先,系统自动检测并清洗异常轨迹和错误动作等低质量数据;随后,引入面向具身追踪的DAgger(Direct Aggregation of Demonstration)策略。在这一策略下,模型在仿真与真机交互中,会主动暴露其薄弱环节,如快速转向失误、短时遮挡丢失等。

针对这些暴露出的弱点,管线会自动补充高价值样本,形成数据闭环。这种机制使得模型不再是一个静态的软件包,而是一个能够在实践中不断修正自身、提升泛化能力的智能体。对于开发者而言,这意味着模型上线后的维护成本大幅降低,系统能够随着使用时间的推移而变得更加“聪明”。

PhyAI框架:降低从原型到量产的适配成本

任何先进模型若缺乏高效的推理框架支持,都难以在工业界大规模落地。此次发布配套的PhyAI推理框架,专为Physical AI场景设计,兼顾端侧极速推理与云端大规模Rollout需求。

在NVIDIA GeForce RTX 5090上,PhyAI对π0、π0.5和GR00T等主流模型实现了显著的加速效果,加速倍数分别达到2.85倍、1.82倍和2.28倍。针对MiniCPM-Robot模型,PhyAI通过CUDA Graph加速、算子融合等深度优化手段,将推理帧率从10.12 Hz提升至36.77 Hz。

特别是针对MiniCPM-Robot定制的融合算子(如RMSNorm+SiLU gate、conv1d+SiLU+QKV split),大幅减少了中间变量的搬运次数。这种对底层硬件特性的深度挖掘,确保了模型在各种NVIDIA硬件平台上都能发挥最佳性能。PhyAI的简洁API设计,也使得开发者能够快速将研究原型转化为高效的生产力工具,降低了从实验室到工厂的适配门槛。

结语:物理智能的“平民化”趋势

面壁智能此次发布的MiniCPM-Robot系列,标志着具身智能技术正从“拼参数、拼算力”的粗放阶段,转向“拼效率、拼落地”的精细化阶段。1.5B参数的VLA模型和0.9B的跟踪模型,证明了轻量级并非意味着低性能,相反,通过架构创新和算法优化,小模型可以在特定领域实现超越大模型的实际效能。

随着乐聚机器人、吉利汽车等产业伙伴的加入,这套技术栈正在展厅导览、园区巡检、生产仓储等真实场景中接受检验。当机器人能够脱离云端依赖,在本地完成复杂的感知、决策与控制时,我们离真正意义上的通用物理智能(Physical AGI)更近了一步。

这一开源成果不仅为开发者提供了低成本的实验工具,更为整个行业指明了一个方向:具身智能的终极竞争,将不再是云端算力的军备竞赛,而是边缘侧能效比的极致优化。未来,更多具备长期记忆、断网自主、自进化能力的“小钢炮”模型,将深入千行万业,成为推动实体经济智能化的核心引擎。