AI基础设施新范式:无问芯穹如何以Agentic Infra重塑算力效率边界
在人工智能技术从单一大语言模型向复杂智能体(Agentic AI)演进的当下,基础设施层正经历着前所未有的范式重构。随着Pre-training(预训练)、Post-training(后训练)、Test-time Scaling(推理时扩展)以及Agentic Scaling(智能体扩展)四条Scaling Laws的共同作用,模型训练与推理的规模边界被不断拓宽。然而,单纯依靠线性堆叠算力产能已无法弥合供需之间日益扩大的缺口。如何在规模扩张的同时保持极致效率,成为AI基础设施领域的核心命题。
无问芯穹联合创始人兼CEO夏立雪在2026年世界人工智能大会上提出的Agentic Infra理念,正是对这一痛点的前瞻性回应。该理念不仅仅是对现有算力的简单聚合,而是通过AI原生的智能体能力,实现基础设施的自我优化、自我进化。这一战略被具象化为“前店后厂一中心”的布局,涵盖了从底层资源汇聚到上层应用赋能的全栈能力。

异构算力的全域聚合与跨域协同突破

智能资源规模的最大化是AI生产力的基石,而异构算力的碎片化是制约规模扩张的最大瓶颈。全球范围内的算力资源呈现出显著的异质化特征,不同代际、不同厂商、不同架构的GPU集群分散在各处,导致资源利用率极低。无问芯穹的Agentic Infra自主式基础设施平台,旨在打造一座“算力集散中心”,通过多元异构、软硬协同的技术路径,将这些散落的算力统一汇聚并弹性调度。

该平台的跨域训练系统已经过大规模生产环境的严苛考验,验证了其在超远距离、多数据中心及混合云场景下的可行性。例如,在无问芯穹联合中国电信完成的国内首例超4000公里大模型跨域混训中,新疆哈密与广东深圳两地集群间的联合训练性能提升了165%。这一突破不仅证明了超远距离跨域协同的技术可行性,更揭示了通过计算通信重叠流水编排、自适应通信流调度等全栈优化手段,可以系统性破解算力聚合难题。

此外,该平台成功盘活了全国超过37,000P的异构算力,覆盖16种主流芯片。在多数据中心聚合场景中,打通4个不同代际集群后,协同性能提升41%;在混合云场景下,本地私有集群与公有云安全互通,整体性能提升68%。这些实测数据表明,Agentic Infra能够有效解决本地算力不足与云上资源闲置的错配痛点,为Agentic AI时代提供坚实的底座支持。

面向智能体的极致推理效率优化

在Token经济时代,推理成本与效率直接决定了AI应用的商业化潜力。无问芯穹的Agentic MaaS大模型服务平台,被定位为一座“Token工厂”,其核心目标是用极致效率服务Token的规模化生产。针对智能体推理需求中上下文长、交互轮次多、缓存命中率高的“三极”特征,无问芯穹首创了跨集群异构PD分离架构(PDD)。

传统的PD分离架构难以应对异构集群中硬件性能的“偏科”现象。PDD架构创新性地将预填充(Prefill)和解码(Decode)任务分离,让算力强的集群专注于Prefill,让显存带宽高的集群专注于Decode,并通过高性价比的广域网以太网连接各地集群。这一设计相当于让每个硬件只执行其最擅长的任务,极大提升了整体效率。
为了解决跨集群KV Cache传输中的带宽和延迟瓶颈,无问芯穹进一步将Decode Radix Cache技术迁移至跨集群架构,使传输数据量降低一个数量级。同时,其创新的P-RLD-MD三级分离式推理架构,通过RelayDecode先行输出Token,无缝切换至MainDecode处理后续任务,有效掩盖了以太网传输延迟。实测数据显示,该架构使首Token延迟降低51.5%,单Token成本降低37.5%。过去一年,无问芯穹推动推理成本下降10倍,随着PDD架构的规模化落地,未来仍有10倍的成本下降空间,形成了“优化即利润”的增长飞轮。

智能体蜂群驱动的自主化运维与算子生成

Agentic Infra的本质在于“AI原生”,即利用智能体赋能基础设施本身,形成闭环优化。无问芯穹构建了基础设施智能体蜂群,包含平台管家、集群运维和算子生成三大子系统,实现了从用户交互到硬件性能释放的全链路智能化。

平台管家智能体系统作为全局统筹者,通过自然语言交互降低用户操作门槛,能够独立解决80%的日常资源运营与排障问题。集群运维智能体系统则化身7×24小时的“运维专家团”,通过故障排查、环境部署等子智能体协作,实现告警自动闭环处置,将运维人效提升5倍以上,关键故障处理效率提升6倍,真正实现了从“人找问题”到“问题自己解决”的转变。

在硬件性能释放的最后一步——算子优化上,无问芯穹推出了KernelMind高性能算子生成智能体系统。该系统通过五步闭环工作流,在真实编译试错中持续自迭代,稳定交付工业级高质量算子。在GLM5.2模型实测中,该系统在NVIDIA旗舰卡上实现端到端7.3%的性能提升,在AMD旗舰卡上更带来39%的整体性能跃升,全面超越行业基线。

向物理世界的延伸:具身智能的基础设施支撑
随着AI技术从数字世界向物理世界渗透,具身智能(Embodied AI)对基础设施提出了新的挑战。无问芯穹发布了首个面向大规模具身任务的云边端一体化管理与调度平台,首次将云端GPU集群、边缘算力节点和机器人真机设备统一接入。

针对具身智能训练中的核心痛点,无问芯穹推出了RLinf V0.3大规模真机强化学习训练框架。通过首创的HotSwarm与端云协同训练模式,该框架支持真机设备1000+次在线上下线且训练0中断,将近百台真机的专线需求降至2Gbps以下,大幅降低了规模化训练的成本门槛。同时,Mizar-Robo全栈推理优化体系通过四层协同优化,让具身模型在低功耗硬件上也能实现高帧率、低延迟的流畅交互。在与自变量机器人WALL-OSS系列的联合优化中,端侧推理时延从500ms压缩至70ms,降幅达86%,为机器人产品的规模化商用提供了有力支撑。

结语与展望
从算力集散中心的资源汇聚,到Token工厂的效率深挖,再到AI生产力商店的产业赋能,无问芯穹的Agentic Infra体系不仅是一套技术方案,更是对AGI时代基础设施演进方向的深刻洞察。通过“用智能进化智能,用生产力加速生产力”,无问芯穹正致力于构建一个能够支撑数字与物理世界所有AI生产力运行的自主化、高效化基础设施生态。在规模与效率两大支点的驱动下,Agentic Infra有望成为推动全球AI产业持续进化的核心引擎。

