动作即Token:眸深智能如何用自进化大脑重塑具身智能终局?

0 阅读

从实验室到商业化:具身智能的“动作革命”

在2026年的科技创投版图中,具身智能(Embodied AI)已从概念炒作迈入实质性的商业化验证阶段。在这一进程中,「眸深智能」(Motion Brain)呈现出一种罕见的爆发态势。这家成立于2025年1月的公司,在短短十八个月内完成了近亿元Pre-A轮追加融资,并紧随其后交割了近5亿元的Pre-A+轮资金。更引人注目的是其估值曲线的陡峭攀升——上半年估值增长超过十倍,这一速度在硬件密集、研发周期长的机器人行业中极为罕见。

这种高速成长的背后,并非单纯的资本助推,而是源于其底层技术路线的根本性重构。由复旦大学深度学习实验室主任陈涛教授、原英特尔中国首席科学家张益民博士与连续创业者穆泽林联合创办的眸深智能,并没有跟随主流VLA(视觉-语言-动作)模型的路径依赖,而是选择了一条更为硬核且底层的技术路线:将“动作”本身视为可计算、可推理的基础单元,即“动作Token”。

“动作Token”:解构机器人行为的通用语言

要理解眸深智能的技术壁垒,首先需厘清其核心概念——动作Token。在传统的具身智能研究中,动作往往被视为连续的物理信号,难以被大语言模型直接处理。眸深智能团队创造性地将连续动作离散化,类比于汉字中的笔画或大语言模型中的Token,建立了包含约3000个“动作基元”的动作词典。

这一举措的意义在于,它让机器人获得了类似人类语言习得的“零样本”泛化能力。正如人类可以通过组合有限的词汇描述从未见过的事物,机器人也能通过重组已掌握的“动作Token”来理解和执行新的复杂任务。这种机制最早体现在其2023年发布的MotionGPT模型中,该模型被发表于顶级会议NeurIPS,标志着全球首个将动作离散化为Token的具身大模型诞生。

在此基础上,眸深智能进一步推出了STI-WM(时空一体世界动作模型)。与依赖海量真机数据采集的传统模型不同,STI-WM采用了一种全新的数据训练配方:80%的互联网视频数据用于学习物理规律和动作因果逻辑,10%的动捕数据用于校准生物力学特征,仅10%的真机数据用于最终的闭环对齐。这种范式将真机数据需求降低了90%,同时将动作准确度提升至99%。

软硬协同:破解端侧部署的算力悖论

尽管算法层面取得了突破,但具身智能的商业化最大拦路虎始终在于端侧算力的成本与实时性要求。云端推理的高延迟无法满足机器人动态交互的需求,而端侧部署往往受限于功耗和算力瓶颈。

眸深智能团队凭借其深厚的芯片背景,在“软硬协同”上构建了极深的护城河。团队从第一代模型起就同步推进模型压缩与国产芯片适配。通过模型蒸馏、冗余参数压缩、Token剪枝及量化等技术,团队成功将千亿参数级模型压缩至百亿级别,在特定场景中参数量降低约75%。

这一工程化突破带来了质的飞跃:端侧推理延迟从约200毫秒压缩至10毫秒左右,足以支持毫秒级的实时控制;模型端侧推理成本从20万元骤降至1万元,而大脑续航时间提升了10倍,精度却未受损。这一成果不仅获得了IJCAI 2025全球最佳论文奖,更使眸深智能成为近五年唯一获此殊荣的中国大陆团队。

值得注意的是,这种软硬协同能力并非孤立存在。团队全面适配了海思(昇腾310/910)、地平线、燧原等国产芯片平台。在当前全球供应链格局下,这种对国产算力的原生支持,不仅解决了供应链安全问题,更通过算子级优化实现了远超行业平均水平的资本效率。

离线自进化:打通落地的最后的一公里

具身智能落地的另一个核心痛点是“长尾场景”的适应性。传统机器人一旦在部署中发现新的非结构化环境bug,往往需要返厂升级或远程重新训练,这在工业巡检、家庭服务等场景中是不可接受的。

眸深智能提出的T²MB(Task*Task Motion Brain)架构,赋予了机器人“离线自进化”的能力。当模型部署到端侧后,机器人能够基于本地交互数据持续优化性能,无需联网回传。这种在线学习能力使得任务执行准确度最高可提升25%,真正实现了“越用越聪明”。这一特性对于需要长期独立工作的服务机器人而言,是颠覆性的体验升级。

技术成熟度的提升也反映在了商业化的进程中。尽管成立仅有一年多,眸深智能已是国内少数实现营收的具身智能大脑公司。2025年审计回款收入达千万元,2026年上半年营收达到3000万元,预计全年营收规模将突破5000万元。客户覆盖工业检测、物业、环卫等高价值场景,并与头部港股物业公司及A股环卫龙头完成了产品交付。

产业格局推演:为什么“大脑”将形成“一超多强”?

随着技术栈的日益复杂,具身智能产业链的分化已不可避免。在眸深智能CEO穆泽林看来,未来的产业分工将趋向于专业化。本体制造可能会像汽车工业一样,涌现出众多各具特色的硬件供应商,但在“大脑”领域,由于研发门槛极高(涉及人才、算力及算法的深度耦合),国内真正具备全栈研发能力的团队屈指可数。

穆泽林预测,未来大脑领域大概率会形成“一超多强”的格局。所谓的“超级通用大脑”,指的是具备极强泛化能力、低算力依赖且支持离线进化的底层架构;而“多强”则是指聚焦特定垂直场景(如电力巡检、快递分拣)的专用大脑或应用层开发商。

这种判断基于一个核心逻辑:大脑的研发投入远超本体,且通用智能是硬件落地的前提。对于绝大多数机器人硬件初创公司而言,自研底层大模型不仅成本高昂,而且难以与头部科技公司抗衡。因此,购买或订阅通用的“具身大脑”服务,将成为行业常态。

国产算力的原生突围与未来展望

在芯片选择上,眸深智能坚定地选择了国产算力原生开发路线。团队早期具备海思、英特尔、英伟达三大芯片巨头的背景,使其具备国内少有的算子级适配能力。这种能力在应对国产芯片时尤为重要。

不同于国内其他普遍采用“国外训练、国产移植”的方案,眸深智能从训练端到推理端均基于国产算力原生开发。这不仅规避了性能损耗和兼容性问题,更在成本上实现了巨大优势。通过算子优化,团队能用1000张国产卡、花费5000万完成训练,而同类方案往往需要1万张卡、花费5亿。这种低成本训练逻辑,使得国产芯片在具身智能时代的普及成为可能。

对于未来芯片机会,穆泽林持谨慎乐观态度。他认为,虽然端侧具身芯片是大机会,但目前多数公司瞄准的200TOPS算力可能迅速过时。随着多模态信号处理的复杂化,算力需求将快速向1000-2000TOPS演进。因此,现阶段聚焦“软硬协同”而非重复造轮子,是更务实的选择。

综上所述,眸深智能的崛起并非偶然。它通过“动作Token”这一创新范式,解决了具身智能从感知到执行的逻辑断层;通过极致的模型压缩与国产芯片适配,打破了端侧部署的成本枷锁;通过离线自进化能力,填补了长尾场景的适应性空白。在2026年的具身智能下半场,这家来自复旦实验室的技术团队,正在重新定义机器人“大脑”的标准。