AI基础设施新范式:无问芯穹Agentic Infra如何重塑算力效率与智能进化

1 阅读

算力困局与范式转移:从线性堆叠到智能原生

当前,人工智能领域正面临一个严峻的结构性矛盾:计算需求呈现指数级攀升,而传统基础设施仅依靠产能的线性增长去堆叠算力,已远远无法弥合供需之间持续扩大的缺口。这一矛盾在从预训练(Pre-training)向后训练(Post-training)、从推理时扩展(Test-time scaling)向智能体扩展(Agentic scaling)演进的过程中尤为突出。在四条Scaling Law的共同作用下,模型训练与推理的超级市场正在互相孕育,这对底层基础设施提出了前所未有的挑战。

无问芯穹夏立雪:基础设施的决胜点是AI原生Agentic Infra

传统的AI基础设施往往被视为被动的资源提供者,但在Agentic AI时代,基础设施必须具备“智能原生”能力。无问芯穹联合创始人兼CEO夏立雪指出,当下的AI基础设施必须以极致的效率服务更大规模。这一观点的核心在于重新定义AI生产力公式:AI生产力等于智能资源规模乘以Token转化效率,再乘以AI生产力转化效率。基于规模与效率两大锚点,无问芯穹提出了Agentic Infra的战略布局,旨在通过基础设施的智能体蜂群赋能,实现资源规模的扩展、Token生产的提效,并支持Agentic AI的持续进化。

无问芯穹夏立雪:基础设施的决胜点是AI原生Agentic Infra

算力集散中心:破解异构算力的全球性难题

Agentic Infra自主式基础设施平台的核心目标,是实现智能资源规模的最大化。它扮演着“算力集散中心”的角色,将散落的、异构的算力资源统一汇聚、弹性调度并按需分发。夏立雪强调,算力的异质化与碎片化是全球性难题,如何高效聚合协同不同区域、不同代际的算力资源,是扩大智能资源规模的关键。

无问芯穹通过“多元异构、软硬协同”技术,打造了面向异构集群的大模型跨域训练系统,并集成于Agentic Infra平台中。该系统通过计算通信重叠的流水编排、自适应的通信流调度和异构算力调度机制,实现了三位一体的全栈协同优化。这一技术体系已经通过了三大类跨域算力聚合训练实践的生产级考验:

无问芯穹夏立雪:基础设施的决胜点是AI原生Agentic Infra

首先是超远距离聚合。无问芯穹联合中国电信,完成了国内首例超4000公里距离的大模型跨域混训。在新疆哈密与广东深圳两地集群间,联合训练性能提升了165%,验证了超远距离跨域集群协同训练的可行性。

其次是多数据中心聚合。通过打通4个不同代际、不同型号的GPU集群,联合训练近百亿参数大模型,四集群协同性能提升了41%。这一成果有效盘活了不同批次的存量异构算力,解决了资源闲置与不足并存的痛点。

最后是混合云算力聚合。实现了本地私有集群与公有云算力的安全互通混训,整体性能提升了68%。这种模式帮助众多企业客户解决了本地算力不足、云上资源闲置的错配问题。

目前,这套跨域训练系统已在全国部署,触达超37,000P算力,覆盖16种主流芯片。随着强化学习成为下一代AI进步的重要手段,跨集群强化学习成为智能规模化及持续进化的新锚点。针对该场景下角色等待时间长、万卡级故障频率高等问题,无问芯穹通过优化计算通信重叠技术,使跨域通信效率提升3-4倍,实现了通信开销100%全掩盖。同时,搭建的故障无感训练机制,成功实现了跨域强化学习训练连续一周0中断稳定运行,为未来支撑十万卡级以上的跨域计算资源奠定了坚实基础。

无问芯穹夏立雪:基础设施的决胜点是AI原生Agentic Infra

Token工厂:以极致效率重构推理成本

photoLink

在Token经济时代,无问芯穹布局的Agentic MaaS大模型服务平台,扮演着“Token工厂”的角色,核心目标是用极致效率服务Token的规模化、高质量生产。智能体推理需求具有上下文极长、交互轮次极多、缓存命中率极高的“三极”特征,这对吞吐、时延和缓存复用的要求远高于传统对话场景。

针对这一挑战,无问芯穹首创了新一代推理系统优化成果——跨集群异构PD分离架构(Prefill-RelayDecode-MainDecode, PDD)。该架构利用高性价比的广域网以太网,将分布在各地的同构数据中心连接起来,让算力强的集群负责Prefill任务,让显存带宽高的集群负责Decode任务。这种设计相当于让“偏科”的硬件只刷自己最擅长的题,极大提升了大模型推理系统的效率。

photoLink

为了解决基于以太网的KV Cache跨集群传输存在的带宽和延迟瓶颈,无问芯穹将Decode Radix Cache技术创新性地迁移至跨集群异构PD分离架构中,使跨集群KV Cache传输数据量降低一个数量级。此外,PDD架构将传统的PD分离链路解构为P-RLD-MD三级分离式推理架构,通过RelayDecode先行输出Token,掩盖了长达数十秒的传输延迟。

实测数据显示,该架构在首Token延迟(TTFT)降低51.5%的同时,单Token成本降低了37.5%。过去一年,无问芯穹通过一系列原始技术创新,推动了推理成本10倍下降。随着跨集群异构PD分离架构的规模化落地,推理成本仍有10倍的下降空间。平台单日Token调用量较去年12月实现了40倍的爆发增长,形成了“业务带技术,技术提效率,效率促增长”的正向循环。

智能体蜂群:基础设施的自主进化与行业赋能

Agentic Infra行业解决方案旨在将计算资源高效转换为高质量Token,并进一步转化为产业真正认可的高质量AI生产力。无问芯穹通过Agentic Infra行业解决方案,携手多行业伙伴赋能千行百业降本提效。在文娱游戏、医疗健康、法律终端、能源电力等多个垂直行业,无问芯穹均提供了定制化的解决方案。

基础设施本身也在经历智能化变革。无问芯穹打造了基础设施智能体蜂群,包含平台管家智能体系统、集群运维智能体系统和算子生成智能体系统。平台管家智能体系统通过自然语言交互,帮助用户操作平台、统筹AI基座,能够独立解决80%的日常问题。集群运维智能体系统实现了从“人找问题”到“问题自己解决”的转变,运维人效提升5倍以上,关键故障处理效率提升6倍。

算子生成智能体系统KernelMind,通过五步闭环工作流,稳定交付可直接落地的高质量工业级算子。在GLM5.2模型的实测中,该系统在NVIDIA旗舰卡中实现了端到端7.3%的性能提升,在AMD旗舰卡中更是带来了39%的整体性能跃升。

无问芯穹夏立雪:基础设施的决胜点是AI原生Agentic Infra

迈向物理世界:具身智能的基础设施支撑

夏立雪将视野延伸至物理世界,提出具身智能的Scaling Law同样需要高效率、大规模的基础设施支持。无问芯穹公布了首个面向大规模具身任务的云边端一体化管理与调度平台,首次把云端GPU集群、边缘算力节点和机器人真机设备统一接入到一个平台中。

针对具身智能的训练与推理部署,无问芯穹发布了大规模真机强化学习训练框架RLinf V0.3和全栈推理优化体系Mizar-Robo。RLinf V0.3支持具身智能大规模真机、跨域端云协同的强化学习训练,支持真机设备1000+次在线上下线,训练0中断,并将近百台真机规模专线需求降至2Gbps以下。Mizar-Robo则全方位释放端侧硬件潜力,在无问芯穹与自变量机器人WALL-OSS系列模型的联合优化部署中,实现了7.14倍的推理性能提升,端侧推理时延从500ms压缩至70ms,降幅达86%。

无问芯穹夏立雪:基础设施的决胜点是AI原生Agentic Infra

从“算力集散中心”做大资源总盘,到“Token工厂”深挖效率红利,再到“AI生产力商店”循环造血向产业输出价值,乃至向物理世界AI的探索与实践,无问芯穹始终锚定“规模与效率”两大支点。Agentic Infra体系不仅是无问芯穹积淀多年的战略蓝图系统性落地,也代表着为未来数字与物理世界的所有AI生产力的运行构筑基础设施的长期方向。

无问芯穹夏立雪:基础设施的决胜点是AI原生Agentic Infra

无问芯穹夏立雪:基础设施的决胜点是AI原生Agentic Infra