动作即Token:眸深智能如何以端侧具身大脑重构机器人产业格局

0 阅读

在人工智能从数字世界向物理世界延伸的关键节点,具身智能(Embodied AI)正成为科技巨头与初创企业竞相争夺的高地。然而,长期以来,如何让机器人像人类一样自然、流畅且具备泛化能力地执行复杂动作,始终是制约行业发展的核心瓶颈。传统视觉-语言-动作(VLA)模型往往受限于海量真机数据的高昂采集成本,且在跨本体迁移时面临严重的性能损耗。在这一背景下,一家成立于2025年初的科技企业——眸深智能,凭借其独创的“世界动作模型”技术路线,正在重新定义具身大脑的标准。

眸深智能的核心创新在于对“动作”本质的重新解构。传统方法通常将动作视为连续的物理信号或离散的简单指令,导致生成的行为缺乏连贯性与多样性。眸深智能团队则提出了一种革命性的视角:将动作映射到隐空间,并引入扩散模型技术。早在2022年,团队便发布了隐空间动作扩散模型(MLD),这一模型摒弃了逐帧教导机器人的传统方式,转而让AI通过去噪过程,从随机噪声中还原出符合生物力学特征的自然姿态。这种“无师自通”的能力,为后续的动作生成奠定了坚实的底层基础。

如果说MLD解决了动作生成的质量问题,那么2023年发布的MotionGPT则解决了动作理解与规划的问题。受到大语言模型(LLM)成功经验的启发,眸深智能创造性地将人体姿态拆解为约3000个“动作基元”,并将其定义为“动作Token”。这就如同汉字由基本笔画组成一样,复杂的机器人行为可以通过预测下一个动作Token来序列化成文。这一突破不仅赋予了机器人Zero-Shot(零样本)泛化能力,使其能够理解并执行从未见过的指令,更实现了全球首个将动作彻底Token化的具身大模型架构。该成果发表于顶级会议NeurIPS 2023,标志着动作理解进入了语言学般的结构化时代。

随着技术的迭代,眸深智能在2026年推出了更为成熟的STI-WM(时空一体世界动作模型)。这一原生具身智能框架实现了空间结构、时间演化、物理一致性与执行鲁棒性的四维统一。尤为值得关注的是其数据训练范式的革新。传统VLA模型极度依赖昂贵的真机数据,而STI-WM采用了“80%互联网视频+10%动捕数据+10%真机数据”的组合策略。通过从海量无标注的视频中学习物理规律,再利用少量高精度数据进行校准,该模型将真机数据的需求量降低了90%,同时将动作准确度提升至99%。这种高效的数据利用方式,极大地加速了模型的训练进程并降低了研发门槛。

除了算法层面的突破,端侧部署能力是眸深智能另一大竞争壁垒。具身智能的最终落地场景往往对实时性和功耗有着严苛要求,依赖云端计算不仅存在延迟风险,还涉及数据隐私问题。眸深智能团队依托核心成员在海思、英特尔、英伟达等芯片巨头的深厚背景,从第一代模型起就同步推进模型压缩与国产芯片适配。通过模型蒸馏、冗余参数压缩以及算子级优化,团队成功将千亿参数级模型压缩至百亿级别,参数量降低约75%,端侧推理延迟从200毫秒骤降至10毫秒左右。

这种软硬协同的策略带来了显著的经济效益。模型端侧推理成本从早期的20万元降至1万元,大脑续航时间提升10倍,且精度未受丝毫影响。这一工程化成就不仅帮助团队获得了IJCAI 2025全球最佳论文奖,更使其成为国内少数具备算子级适配能力的具身大模型团队。目前,眸深智能已打通昇腾310/910、地平线、燧原S60等国产芯片平台,实现了低功耗、高实时的端侧推理。这意味着,机器人不再需要昂贵的进口算力支持,即可在本地完成复杂的任务规划与控制。

在商业化进程中,眸深智能展现出惊人的增长速度。2025年审计回款收入达千万元,2026年上半年更是突破3000万元,预计全年营收规模超过5000万元。其客户群体已覆盖工业检测、物业服务、环卫清洁等多个高频刚需场景。例如,在与某港股上市物业公司及A股环卫龙头的合作中,眸深智能的大脑已成功交付并投入实际运营。此外,公司正积极推进与头部连锁零售集团及白色家电工厂的人形机器人落地研发,显示出其技术在多样化场景中的强大适应性。

眸深智能的快速崛起也引发了资本市场的热烈追捧。在完成3亿元Pre-A轮融资后仅两个月,公司再次获得近亿元Pre-A轮追加融资,估值在半年内增长超10倍。投资方包括瑾悦投资、创合汇资本及徐汇资本等知名机构。这种资本青睐并非偶然,而是基于对其技术护城河与商业落地能力的双重认可。特别是在当前全球供应链不确定性增加的背景下,眸深智能坚持基于国产算力芯片进行原生开发,实现了技术栈的完全自主可控,这为其长期发展提供了坚实的安全保障。

对于未来产业格局,眸深智能创始人穆泽林认为,具身智能领域将形成“一超多强”的局面。通用大脑的研发门槛极高,涉及人才、算力及软硬件深度结合,只有少数团队能够胜任。而本体制造则可能像汽车行业一样,呈现出多样化的特色。眸深智能的目标是成为那个提供通用大脑的“超级供应商”,允许其他合作伙伴聚焦于细分场景的本体优化与应用开发。这种分工协作的模式,有望加速具身智能在整个社会的普及与应用。

值得注意的是,眸深智能的技术影响力已延伸至国际顶尖实验室。英伟达DAIR实验室在其最新的ARDY模型中,多次引用了眸深智能的MLD与MotionGPT技术。这不仅证明了其技术路线的前瞻性与有效性,也表明中国企业在具身智能基础理论层面已开始占据重要地位。从跟随者到引领者,眸深智能的实践为中国AI产业提供了一条可借鉴的路径:即在基础算法创新与工程化落地之间找到平衡点,通过软硬协同解决实际问题。

面对未来,眸深智能并未止步于当前的成就。团队计划在下半年攻克千卡级国产集群训练,实现纯国产化的大模型训练方案。这将进一步降低训练成本,提升资本效率,类似于DeepSeek在低成本训练领域的突破逻辑。同时,随着触觉、传感器等多模态信号的融入,端侧算力需求预计将快速提升至1000-2000TOPS。眸深智能将继续深化与芯片公司的合作,通过算子优化挖掘现有硬件潜力,而非盲目重复造轮子。

综上所述,眸深智能通过独特的动作Token化技术、高效的数据训练范式以及卓越的端侧部署能力,成功构建了具身智能领域的竞争壁垒。其不仅在技术上实现了从动作生成到任务规划的闭环,更在商业上验证了规模化落地的可行性。在国产替代与智能化升级的双重驱动下,眸深智能有望成为推动中国具身智能产业发展的关键力量,为亿万台机器人装上真正聪明、高效且自主的“大脑”。这一进程不仅关乎一家企业的成败,更预示着物理世界智能化变革的加速到来。