破解算力困局:无问芯穹Agentic Infra如何重塑AI生产力范式
随着人工智能技术从预训练阶段迈向智能体扩展时代,计算需求呈现出指数级攀升态势。传统依靠线性增加硬件产能来应对算力缺口的方式,已逐渐触及天花板。在这一关键转折点,基础设施的演进逻辑正在发生根本性变革。无问芯穹联合创始人兼CEO夏立雪在2026年世界人工智能大会上提出的观点极具前瞻性:AI基础设施必须从单纯的资源供给者,转型为以极致效率服务大规模智能进化的赋能者。这种转变的核心,在于构建一套能够自主适应、自我优化的Agentic Infra体系。

面对全球范围内算力资源的异质化与碎片化现状,如何高效聚合分散的计算资源成为行业痛点。无问芯穹推出的“算力集散中心”,即Agentic Infra自主式基础设施平台,旨在通过技术手段打破物理边界。该平台并非简单的资源拼接,而是基于多元异构与软硬协同技术,实现了跨地域、跨代际、跨云环境的算力统一调度。通过计算通信重叠的流水编排与自适应通信流调度,系统能够有效掩盖网络延迟带来的性能损耗。

在实际应用场景中,这一架构展现了强大的生命力。例如,在超远距离聚合场景中,新疆哈密与广东深圳两地集群实现了联合训练性能165%的提升,验证了数千公里跨域协同的可行性。而在多数据中心聚合方面,打通不同型号GPU集群进行百亿参数模型训练,不仅盘活了存量资产,更将协同性能提升了41%。这些实践表明,通过全局资源一盘棋调度,异构算力不再是阻碍,反而成为了提升系统韧性与规模的关键要素。

特别值得注意的是,针对下一代AI核心驱动力——强化学习,跨集群训练面临着通信延迟与故障频发的双重挑战。无问芯穹通过全栈协同优化,将跨域通信效率提升了3至4倍,并构建了故障无感训练机制,实现了连续一周零中断的稳定运行。这种稳定性对于需要长时间持续进化的智能体而言至关重要,它为十万卡级规模的跨域计算资源支撑奠定了坚实基础,确保智能体能够在在线进化过程中保持连贯性与高效性。

如果说算力集散中心解决了“有没有”的问题,那么“Token工厂”则致力于解决“快不快”与“贵不贵”的效率难题。在Token经济时代,推理成本直接决定了AI应用的商业化边界。无问芯穹Agentic MaaS大模型服务平台通过首创的跨集群异构PD分离架构(PDD),重新定义了推理系统的效率标准。该架构巧妙地将Prefill、RelayDecode与MainDecode三个阶段分离,利用高性价比广域网连接各地同构数据中心,让擅长计算的集群处理Prefill任务,让显存带宽高的集群负责Decode任务。

这种“偏科”硬件各司其职的设计,极大提升了整体系统效率。然而,以太网传输带来的带宽与延迟瓶颈曾是制约该架构落地的关键。为此,无问芯穹创新性地引入Decode Radix Cache技术,将跨集群KV Cache传输数据量降低一个数量级,有效缓解了流量过载问题。更为精妙的是,通过三级分离式推理架构,系统利用少量机器承担RelayDecode任务,先行输出Token以掩盖传输延迟,随后无缝切换至MainDecode处理后续任务。实测数据显示,该架构使首Token延迟降低了51.5%,单Token成本下降了37.5%。

这一技术突破不仅提升了用户体验,更释放了全域异构算力的产业价值。通过与头部大模型企业的深度合作,无问芯穹在真实业务场景中积累了大量优化经验,形成了“业务带技术,技术提效率,效率促增长”的正向循环。过去一年内,推理成本实现了10倍下降,且未来仍有巨大的优化空间。这种“优化即利润”的增长飞轮,正在成为推动AI普及的重要动力。

然而,基础设施的价值最终需体现在对千行百业的赋能上。无问芯穹打造的“AI生产力商店”,即Agentic Infra行业解决方案,旨在将高效的计算资源转化为各行业认可的生产力。在文娱游戏领域,通过AGENTIC 3D GAME GEN解决方案,创意输入被高效转化为可执行的3D模型,大幅缩短了内容生产周期。在医疗健康领域,助力医院实现大模型在临床诊疗辅助与运营管理中的落地,提升了医疗服务的质量与效率。

在法律终端场景,专属AI合伙人“律盾芯人”的出现,推动了法律行业的智能化安全升级,帮助律师事务所处理繁杂的法律文书与案例检索工作。而在能源电力领域,基于智能体技术的智算中心能耗智能预测与协同调度解决方案,则为绿色计算提供了新的思路。这些垂直行业的成功案例证明,只有深入理解业务场景,才能打造出真正具备商业价值的AI应用。

值得一提的是,无问芯穹还将智能体能力反向应用于基础设施本身,构建了基础设施智能体蜂群。这套系统包含平台管家、集群运维与算子生成三个子集,实现了从用户交互到底层硬件优化的全流程自动化。平台管家智能体通过自然语言交互,帮助用户轻松完成复杂的资源管理与排障工作,独立解决80%的日常问题。集群运维智能体则像一支全天候值守的专家团,通过自动闭环处置告警与周期性巡检,将运维模式从“人找问题”转变为“问题找人”,使人效提升5倍以上。

在更底层的算子优化环节,KernelMind算子生成智能体系统通过五步闭环工作流,持续自迭代并交付高质量工业级算子。在GLM5.2模型实测中,该系统在NVIDIA旗舰卡中实现了7.3%的性能提升,在AMD旗舰卡中更是带来了39%的整体性能跃升。这种由智能体驱动的基础设施自主迭代能力,使得系统能够越用越强,不断逼近硬件性能的极限。

随着AI技术向物理世界延伸,具身智能成为新的关注焦点。无问芯穹发布的云边端一体化管理与调度平台,首次将云端GPU集群、边缘算力节点与机器人真机设备统一接入,解决了具身训练中资源分散与协同困难的痛点。RLinf V0.3框架支持大规模真机跨域端云协同强化学习训练,实现了真机设备1000+次在线上下线而训练零中断,并将专线需求降至2Gbps以下,大幅降低了规模化训练的成本门槛。

同时,Mizar-Robo全栈推理优化体系通过多层协同优化,释放了端侧硬件潜力。在与自变量机器人WALL-OSS系列模型的联合优化中,推理性能提升了7.14倍,端侧推理时延从500ms压缩至70ms。这不仅保障了实时交互的流畅度,也延长了作业续航,为机器人产品从实验室走向规模化商用提供了有力支撑。

从数字世界的算力聚合到物理世界的具身智能,无问芯穹始终锚定规模与效率两大支点。通过“前店后厂一中心”的战略布局,其不仅解决了当前AI基础设施面临的诸多挑战,更为未来AGI时代的到来构筑了坚实底座。让智能无所不能是AGI的目标,而让智能无处不在则是AGI Infra的使命。在这一进程中,基础设施的智能化与自主化将成为推动社会生产力变革的关键力量,引领我们进入一个更加高效、智能的新时代。
















