1.5B模型挑战具身智能极限:小参数如何重塑机器人行动逻辑

0 阅读

小参数背后的具身智能新范式

具身智能(Embodied AI)行业正经历一场从“拼规模”到“拼效率”的深刻转折。长期以来,大模型的性能指标往往与参数量成正比,但在物理世界中,计算延迟、能耗限制以及实时交互的严苛要求,使得庞大的模型难以直接移植。面壁智能近期发布的MiniCPM-Robot系列模型,以1.5B和0.9B的轻量级规模,在通用视觉-语言-动作(VLA)领域展示了惊人的竞争力。这不仅是一个技术发布的新闻,更是具身智能走向工业化落地的一个重要信号:机器人需要的不是一个博学的“大脑”,而是一个反应迅速、记忆精准且能独立运作的“小脑”。

在WAIC期间亮相的MiniCPM-RobotManip,作为核心的VLA模型,其参数量仅为1.5B。然而,在LIBERO、Calvin等主流评测基准中,其表现已跻身第一梯队,与部分更大规模的闭源或开源模型持平。更令人关注的是其在真实场景中的表现:两只机械臂协作制作三明治,从取面包到叠加食材,动作流畅且无停滞。这种流畅感源于模型对“时间”的掌控。传统VLA模型往往基于单帧图像做决策,导致动作僵硬;而MiniCPM-RobotManip引入了历史观测与动作序列的记忆机制,能够理解任务的上下文阶段,从而避免“失忆”导致的操作中断。

突破记忆瓶颈:流式计算与Token压缩

机器人执行长程任务的最大痛点在于“上下文窗口”的计算爆炸。随着任务时长增加,累积的视觉信息呈线性甚至指数级增长,导致推理延迟飙升。MiniCPM-RobotManip通过两项核心技术解决了这一难题:视觉Token压缩与流式计算。

首先,模型摒弃了对所有视觉细节同等对待的传统做法。对于桌面纹理、墙面图案等与当前任务无关的背景信息,模型采用极简的数据表示,仅保留关键语义特征。这种“信息瘦身”大幅降低了单次推理的Token数量,使得H100显卡上的单次决策延迟控制在120毫秒左右,相比π0.5的234毫秒接近减半。在机器人控制中,这100多毫秒的差异,决定了动作是丝滑流畅还是卡顿断裂。

其次,针对历史记忆的存储问题,模型采用了类似观看连续剧的流式计算架构。常规方法在每处理新帧时,需重新计算此前所有历史信息,导致计算量随时间剧烈波动。而MiniCPM-RobotManip复用已处理的信息状态,新画面仅需增量计算。这种机制不仅降低了算力需求,更使得机器人能够携带更长的历史记忆执行任务,如在RMBench测试中,其得分高达53分,远超接近随机水平的竞争者。

端侧智能:无网环境下的生存能力

具身智能落地的另一大障碍是网络依赖。在电梯、地下停车场或工厂车间等信号屏蔽区域,云端推理往往失效。MiniCPM-RobotTrack模型的发布,展示了端侧智能的强大生命力。该模型基于0.9B参数构建,专为机器狗等移动平台设计,能够在宇树Go2 Edu等本地算力设备上稳定运行。

在复杂动态环境中,MiniCPM-RobotTrack展现了卓越的鲁棒性。无论是单目标跟踪、多人交叉干扰,还是模糊指令(如“跟随穿黑衣服的人”),其追踪率均达到开源方案最优水平。更关键的是,即使在拔掉网线的无网环境下,模型仍能通过本地摄像头画面和自然语言指令,实时完成目标识别、运动规划与控制输出,端到端响应延迟稳定在180毫秒以内。

这种离线能力并非偶然,而是源于自进化数据管线的闭环训练。团队构建了自动更新的“错题本”,收集横穿、遮挡、快速转向等长尾罕见场景,通过专家策略纠偏并回传训练,使模型在真实世界的边缘案例中不断进化。这种“数据-模型-硬件”的闭环,确保了机器人在面对不可预测的物理世界时,具备足够的容错与恢复能力。

基础设施协同:PhyAI与工程化落地

模型能力的突破需要工程框架的支撑。为此,面壁智能联合明体科技、北京大学等机构开源了PhyAI推理框架。该框架专为Physical AI设计,旨在解决不同VLA模型在硬件适配、量化与算子优化上的工程壁垒。

在RTX 5090等主流硬件上,PhyAI通过CUDA Graph技术与定制融合算子,显著提升了推理帧率。例如,在适配MiniCPM-RobotManip时,推理帧率从10.12Hz跃升至36.77Hz。这一性能飞跃意味着机器人可以实现更高频的动作修正,从而在高速运动中保持稳定性。PhyAI不仅加速了模型部署,更降低了开发者的迁移成本,使得新模型能够快速适配到各类真实机器人本体上。

从实验室到车间:通用性与专用性的平衡

具身智能的最终价值在于解决实际问题。面壁智能并未止步于模型榜单,而是积极寻求与行业龙头的合作,推动技术规模化落地。与乐聚机器人的合作中,双方组合多模态大模型、机器人本体与导航系统,开发了展厅导览与园区巡检Agent。在无网环境下,导览机器人仍能基于本地知识库进行离线讲解与自由问答,实现了隐私数据本地化处理与自主避障。

在与吉利汽车的合作中,RoboHarness框架被引入仓储物流场景。该框架作为物理世界中的Agent执行中枢,统筹VLM的任务规划、VLA的动作执行与导航系统的空间感知。面对长程任务,框架管理上下文记忆,并在任务失败时自动重试与恢复。每完成一次任务,运行数据进入可治理的数据闭环,持续反哺模型进化。这种“先通用、后专用”的路径,符合大型语言模型的发展经验,即先建立对物理世界的基本常识理解,再针对特定领域进行精细化优化。

结语:定义具身智能的“性价比”

1.5B参数的MiniCPM-RobotManip之所以重要,并非因为它是“最小的”,而是因为它证明了在具身智能领域,参数规模并非唯一决定因素。在物理世界中,机器人需要的是高性价比的智能:反应够快、记忆够准、断网能跑、成本可控。

这一系列模型及其配套的PhyAI框架,展示了一条清晰的落地路径:通过压缩视觉Token和优化推理流,降低计算门槛;通过端侧部署与离线能力,克服环境限制;通过闭环数据管线,解决长尾问题。当AI长出手脚,它不仅要“聪明”,更要“实用”。MiniCPM-Robot系列的出现,标志着具身智能正在从展示Demo的阶段,迈向真正融入工业生产与日常生活的实用化新阶段。