AI基础设施新范式:为何Agentic Infra是决胜2025的关键?
在人工智能技术呈指数级爆发的当下,一个日益严峻的矛盾正摆在全球科技行业面前:计算需求的爆炸式增长与硬件产能线性扩展之间的巨大鸿沟。传统的“堆料”式算力建设策略已触及天花板,单纯依赖增加GPU数量或带宽,无法有效弥合供需缺口。在此背景下,基础设施的建设重心正从单纯的资源堆砌转向效率与智能化的深度重构。无问芯穹联合创始人兼CEO夏立雪在2026年世界人工智能大会上提出的“Agentic Infra”概念,正是对这一行业痛点的系统性回应。它标志着AI基础设施进入了一个新阶段——不再仅仅是被动的资源提供者,而是具备自主进化能力的智能体集群。

异构算力的“大航海时代”:从碎片化到一盘棋

算力资源的异质化与碎片化,已成为制约大模型规模化训练的核心瓶颈。全球范围内,不同代际、不同厂商、不同地理位置的算力资源如同散落的岛屿,难以形成合力。无问芯穹提出的“算力集散中心”,旨在通过Agentic Infra自主式基础设施平台,打破这种物理和逻辑上的壁垒。

这一平台的核心能力在于对多元异构算力的统一汇聚与弹性调度。通过“多元异构、软硬协同”的技术路线,系统能够在计算、通信、存储三个维度实现全栈协同优化。其技术突破体现在三个关键场景中:首先是超远距离聚合,通过在超4000公里跨域集群间实现联合训练,不仅验证了长距离通信的可控性,更将训练性能提升了165%;其次是多数据中心聚合,通过打通四个不同代际的GPU集群,协同性能提升41%,极大盘活了存量异构算力;最后是混合云场景,解决本地私有算力与公有云闲置资源的错配问题,性能提升达68%。

更为关键的是,随着强化学习成为下一代AI进步的关键手段,跨集群强化学习对硬件规模和稳定性的要求达到了前所未有的高度。无问芯穹通过优化计算通信重叠技术,将跨域通信效率提升3-4倍,并构建了故障无感的训练机制,实现了跨域强化学习训练连续一周零中断。这种“跑得通、跑得快、跑得稳”的能力,为支撑十万卡级以上的超大规模智能体进化奠定了坚实基础。

Token工厂的极致效率革命:以“效”搏大

如果说算力底座解决了“有无”问题,那么Token的生产效率则决定了AI应用的商业生命力。在“Token经济”时代,推理成本的控制直接关乎大模型服务的普及率。无问芯穹打造的“Token工厂”——Agentic MaaS大模型服务平台,其核心逻辑是用极致的效率来服务Token的规模化生产。

针对智能体推理场景中“上下文极长、交互轮次极多、缓存命中率极高”的特性,传统同构集群往往面临“偏科”困境。为此,无问芯穹首创了跨集群异构PD分离架构(PDD)。这一架构将Prefill(预填充)和Decode(解码)阶段进行解耦,让算力强的集群负责Prefill,显存带宽高的集群负责Decode。通过广域网以太网将这些分散的集群连接起来,相当于让每台硬件只做它最擅长的事。

为了解决跨集群KV Cache传输中的带宽与延迟瓶颈,系统在PDD架构中引入了Decode Radix Cache技术,使跨集群传输数据量降低一个数量级。同时,创新的P-RLD-MD三级分离式推理架构,通过RelayDecode先行输出Token,完美掩盖了以太网传输的延迟。实测数据显示,该架构使首Token延迟(TTFT)降低51.5%,单Token成本降低37.5%。

这种“优化即利润”的增长飞轮,正在推动推理成本呈十倍级下降。随着平台与头部大模型企业的深度合作,单日Token调用量实现爆发式增长,形成了“业务带技术,技术提效率,效率促增长”的正向循环。这不仅是一场技术革新,更是一场关于AI生产成本的经济学革命。

智能体蜂群:基础设施的自我进化能力

Agentic Infra的真正突破,在于它将“智能体”的概念从应用层下沉到了基础设施层。无问芯穹构建了由平台管家、集群运维、算子生成三大子集组成的“基础设施智能体蜂群”,实现了基础设施的自我优化与迭代。

平台管家智能体系统充当全局统筹者,通过自然语言交互降低用户门槛,能够独立解决80%的日常资源管理与排障问题。集群运维智能体系统则扮演着7x24小时的“运维专家团”,将运维模式从“人找问题”转变为“问题自动解决”,使关键故障处理效率提升6倍。

在算子生成层面,KernelMind智能体系统通过“需求分析—智能调度—内核生成—沙箱验证—评审沉淀”的闭环工作流,能够稳定交付工业级高质量算子。在GLM5.2模型的实测中,该系统在NVIDIA和AMD旗舰卡上均实现了显著的性能提升,特别是在AMD硬件上带来了39%的整体性能跃升。这表明,基础设施正在通过智能体技术,实现对硬件性能的极限压榨。

从数字世界到物理世界:具身智能的新基石

AI的终极形态必然走向物理世界。具身智能(Embodied AI)的规模化落地,同样需要高效、大规模的基础设施支持。无问芯穹在此领域发布了首个面向大规模具身任务的云边端一体化管理与调度平台,将云端GPU、边缘节点和机器人真机统一接入,实现了训练、数据采集、评测和真机执行的统一编排。

针对具身智能的核心痛点,升级后的RLinf V0.3框架支持大规模真机跨域端云协同强化学习,实现了真机设备千次级在线上下线且训练零中断。这一突破将专线需求降至2Gbps以下,大幅降低了规模化训练的成本门槛。与此同时,Mizar-Robo全栈推理优化体系,通过四层协同优化,使端侧推理时延从500ms压缩至70ms,降幅达86%。在自变量机器人WALL-OSS模型的联合优化中,推理性能提升7.14倍,为机器人从实验室走向规模化商用提供了关键支撑。

结语:重塑AI生产力的底层逻辑

从预训练到后训练,从推理时扩展到智能体扩展,AI的发展正在经历深刻的范式转移。无问芯穹提出的Agentic Infra,通过“前店后厂一中心”的战略布局,不仅解决了算力聚合与效率优化的技术问题,更重新定义了AI基础设施的价值主张。

它不再仅仅是算力的容器,而是AI生产力的转化器。通过智能体蜂群实现基础设施的自我进化,通过极致优化降低Token生产边际成本,通过云边端协同打通物理世界的应用闭环。在AGI时代,基础设施的决胜点在于其是否具备“原生”的智能属性。唯有通过智能进化智能,用生产力加速生产力,才能在这个充满不确定性的技术变革中,构筑起最坚实、最灵活的数字底座。这不仅是无问芯穹的战略方向,更是整个AI基础设施行业未来发展的必然路径。

