具身智能落地难?APXInf 开源端侧推理引擎解决机器人实时控制瓶颈

0 阅读

具身智能卡在“最后一公里”:模型聪明,但机器人动得不够快

今天的具身模型已经能看懂环境、听懂指令,并把多模态信息转化为动作决策。但真要让机器人在物理世界里连续干活,光有“聪明的大脑”远远不够。从眼睛看到、耳朵听到,到大脑做出决策,再到手脚执行动作——整套流程必须在极短时间内完成闭环。这个闭环的速度,直接决定了机器人是流畅作业还是频频失误。

文章配图

问题在于,很多在云端跑得很好的具身模型,一部署到机器人本体上就“水土不服”。不是模型不够强,而是推理系统没跟上。开发者常遇到几个现实问题:模型能不能开机秒加载?有限的算力能不能被榨干?每次推理的延迟会不会拖后腿?开发环境里稳如泰山的模型,到了真实机器人上会不会突然翻车?

文章配图

对聊天机器人来说,几百毫秒延迟只是体验稍差;但对需要持续感知、连续决策和实时控制的机器人而言,这点延迟可能导致动作迟滞、轨迹断裂,甚至任务失败。更别说规模化落地还要算经济账:算力成本、功耗、硬件资源利用率,样样都得精打细算。

文章配图

因此,具身智能真正需要的,不是简单把云端推理框架“搬”到端侧,而是一套专为机器人场景设计的端侧推理系统——在有限算力、功耗和成本下,兼顾小 Batch、低延迟、高稳定性和持续交互能力,同时充分挖掘硬件性能上限。

文章配图

APXInf:专为机器人打造的端侧推理引擎

今天,无问芯穹联合清华大学、上海交通大学,正式开源具身智能端侧推理引擎 APXInf,直击从模型能力到规模化落地的核心瓶颈。它支持 RTX 4090、Jetson Orin、Jetson Thor 等主流计算平台,覆盖从模型开发、验证到本体部署的完整链路。目标不只是让模型“跑起来”,更要“跑得快、跑得稳、跑得容易迭代”。

目前,APXInf 已实现关键突破:

  • 在 Jetson Thor 上,PI 0.5 模型使用 FP8 量化,端到端推理延迟从 278ms 降至 26ms 以内
  • 推理频率达到 38.46Hz,完全满足多场景下机器人实时控制的需求

这意味着机器人的“感知-决策-动作”闭环速度提升了近 11 倍,为真实作业提供了充足的响应时间。

更快:端到端优化,不是只拼单点性能

APXInf 的“快”,不是追求某个算子的理论峰值,而是围绕机器人真实执行链路做系统性优化。它从 Pipeline、Graph、Kernel 到量化策略,层层压缩延迟。

比如,通过冗余特性设计,为模型定制轻量化的运行时环境,减少不必要的调度开销;再结合 Agent4Kernel 技术,将多个算子融合成高度优化的复合操作,避免中间数据搬运和内存分配的损耗。

这种端到端思路带来的效果是实打实的:在 Jetson Thor 上,PI 0.5 的推理延迟压到 26ms 以下,频率突破 38Hz。这个速度已经足够支撑大多数抓取、导航、人机交互等任务的实时控制需求。对开发者来说,这意味着模型不再只是 Demo 里的“花瓶”,而是真能在产线或家庭环境中持续工作的“劳动力”。

更稳:Rust 构建运行时,扛得住长期运行

机器人不是跑一次就完事的实验设备。它要在真实环境中连续工作数小时甚至数天,同时处理感知、推理、控制等多个模块的并发任务。这时候,最怕的不是偶尔慢一点,而是系统抖动、内存泄漏、进程崩溃——这些都会导致整个任务中断。

APXInf 的“稳”,正是针对这种长期运行场景设计的。它的核心运行时用 Rust 编写,利用其内存安全特性,从源头规避空指针、越界访问、数据竞争等常见错误。同时,架构上采用极简设计,功能模块清晰隔离,运行开销可控,便于核查和验证。

上层则通过 Python 接口封装,保留开发者熟悉的调用方式。你不需要深入底层 C++ 或 CUDA 代码,就能完成模型部署和参数调整。这种“底层硬核、上层易用”的组合,既保证了系统稳定性,又降低了使用门槛。

更敏捷:面向 Agentic Engineering 的新范式

除了跑得快、跑得稳,APXInf 还试图解决一个更长远的问题:如何让新模型快速接入并持续迭代?

当前很多推理引擎要么性能强但接入复杂,要么接口简单但难以扩展。而具身模型正快速演进,VLA(视觉语言动作)、VLM(视觉语言模型)、世界模型等新架构层出不穷。如果每次换模型都要重写大量适配代码,工程成本会非常高。

APXInf 从设计之初就以 Agentic Engineering 为出发点。它通过冗余特性、功能隔离和工具箱式模块设计,让新模型的接入变得更像“搭积木”。开发者可以复用已有优化策略,只需关注模型特有的部分。未来,这套机制还将支持代码 Agent 自动参与模型适配和性能调优,进一步提升研发效率。

换句话说,APXInf 不只想做一个“执行器”,更希望成为连接模型、硬件、机器人和开发者的Agentic Infra 枢纽,推动整个生态向自动化、智能化演进。

开源现状与未来路线

APXInf 首发支持两款主流具身模型:PI 0.5WALL-OSS,硬件覆盖 Jetson Orin、Jetson Thor 和桌面级 RTX 4090,提供统一的模型接入接口。

接下来的路线图包括:

  • 扩展支持更多模型类型,如 VLA、VLM、世界模型(Qwen、Groot 等已在适配)
  • 持续优化重点开源模型,扩充 SOTA 性能列表
  • 探索 nvfp4 等更激进的量化方案,进一步压低延迟
  • 拓展国产化生态,支持国产芯片和机器人操作系统
  • 适配 AMD 等行业主流 GPU

衔接 RLinf:打通训练到部署的全链路

值得注意的是,APXInf 并非孤立项目。它与此前开源的 RLinf 强化学习训练框架形成互补。RLinf 专注于具身大模型的后训练和能力对齐,而 APXInf 则负责将训练好的模型高效部署到机器人本体。

两者共同构成了一条完整的工程链路:从云端训练、效果验证,到端侧推理、真实运行。开发者可以在同一技术生态下完成全流程开发,避免在不同工具间反复切换和适配。

这种“训练-推理”一体化的设计,正是具身智能走向工业级落地的关键一步。

开源邀请:一起打磨端侧推理标准

APXInf 第一版只是一个起点。无问芯穹希望联合具身模型开发者、机器人团队和系统工程师,共同把模型接入、性能优化和本体部署沉淀为可复用的标准流程。

如果你正在:

  • 尝试将 PI 0.5 等模型部署到机器人本体
  • 基于 Jetson Thor/Orin 或 RTX 4090 开发项目
  • 为新模型寻找高效的端侧推理方案
  • 希望参与 Skill 接入或 Agentic 部署流程建设

欢迎体验 APXInf,提交 Issue 或贡献 PR。

开源地址:

具身智能的未来不在云端,而在真实世界的每一次抓取、移动和交互中。APXInf 正试图缩短从“模型会做”到“机器人真做出来”之间的那“最后一公里”。