算力困局破局者:无问芯穹Agentic Infra如何重构AI生产力底座
人工智能领域的竞争焦点正经历深刻重构。当算力成为新时代的“石油”,传统的线性产能堆叠已无法应对指数级增长的需求。在2026年世界人工智能大会上,无问芯穹联合创始人兼CEO夏立雪提出的观点直击行业痛点:从预训练到后训练,从推理时扩展到智能体扩展,四条Scaling Law共同作用下的超级市场正在互相孕育。这意味着,AI基础设施的定义必须从单纯的硬件供应,转向以极致效率服务更大规模智能资源的新范式。

无问芯穹推出的Agentic Infra战略布局,并非简单的产品迭代,而是一次对AI生产力公式的重新定义:AI生产力等于智能资源规模乘以Token转化效率,再乘以AI生产力转化效率。这一公式背后,是“前店后厂一中心”的战略闭环——以“算力集散中心”汇聚异构资源,以“Token工厂”提升生成效率,以“AI生产力商店”赋能行业落地。这种层层递进的架构,旨在解决当前AI基础设施面临的三大核心挑战:算力碎片化、推理成本高企以及行业应用转化难。

异构算力的聚合是全球性难题。不同芯片、不同代际、不同地域的算力资源如同孤岛,如何将其高效连接并协同工作,是扩大智能资源规模的关键。无问芯穹通过“多元异构、软硬协同”技术,打造了面向异构集群的大模型跨域训练系统。这不仅仅是技术的突破,更是生产方式的变革。

该系统已在三个维度的实践中验证了其价值。首先是超远距离聚合,无问芯穹联合中国电信完成了国内首例超4000公里的大模型跨域混训,在新疆哈密与广东深圳两地集群间,实现联合训练性能提升165%。这一突破证明了地理距离不再是算力协同的绝对壁垒。其次是多数据中心聚合,通过打通四个不同代际的GPU集群,联合训练近百亿参数大模型,四集群协同性能提升41%,有效盘活了存量异构算力。最后是混合云算力聚合,实现本地私有集群与公有云算力的安全互通,整体性能提升68%,解决了企业本地算力不足与云上资源闲置的错配痛点。

目前,这套跨域训练系统已在全国部署,触达超过37,000P算力,覆盖16种主流芯片。这一庞大的资源网络,为Agentic AI时代的持续进化奠定了坚实基础。特别是在强化学习这一下一代AI进步的重要手段中,跨集群强化学习成为智能规模化及持续进化的新锚点。面对万卡级规模下的故障频发和长等待时间问题,无问芯穹通过全栈协同优化,实现了全局资源一盘棋调度,将跨域通信效率提升3-4倍,并实现了跨域强化学习训练连续一周0中断稳定运行。

在Token经济时代,推理成本的控制直接决定了AI应用的商业潜力。无问芯穹的Agentic MaaS大模型服务平台,定位为一座“Token工厂”,其核心目标是用极致效率服务Token的规模化、高质量生产。面对智能体推理需求中上下文极长、交互轮次极多、缓存命中率极高的“三极”特征,传统推理架构显得力不从心。

为此,无问芯穹首创了跨集群异构PD分离架构(Prefill-RelayDecode-MainDecode, PDD)。这一架构的创新之处在于,它不再强求所有硬件都具备同等性能,而是根据芯片特性进行分工:让算力强的集群负责Prefill任务,让显存带宽高的集群负责Decode任务。这种“让偏科硬件只刷擅长题目”的设计,极大提升了系统效率。

为解决跨集群传输中的带宽和延迟瓶颈,无问芯穹将Decode Radix Cache技术创新性地迁移至PDD架构中,使跨集群KV Cache传输数据量降低一个数量级。同时,通过引入RelayDecode机制,系统在高传输延迟请求下先行输出Token,用户侧完全感知不到延迟,随后无缝切换给MainDecode处理。实测数据显示,该架构使首Token延迟降低51.5%,单Token成本降低37.5%。过去一年,无问芯穹推动了推理成本10倍下降,而未来仍有10倍的下降空间。这种“优化即利润”的增长飞轮,正在通过Kimi、智谱等头部大模型企业的真实业务场景中得到验证,平台单日Token调用量实现40倍爆发增长。

基础设施的价值最终体现在对行业的赋能上。无问芯穹通过Agentic Infra行业解决方案,将计算资源高效转化为产业认可的AI生产力。在文娱游戏领域,联合VAST打造的AGENTIC 3D GAME GEN解决方案,将分散创意转化为可执行3D模型;在医疗健康领域,服务上海瑞金医院,助力医疗大模型在临床诊疗辅助等场景落地;在法律领域,打造律所专属AI合伙人;在能源电力领域,探索智算中心能耗智能预测与协同调度。

更值得关注的是,无问芯穹将智能体的能力反向应用于基础设施本身,打造了基础设施智能体蜂群。这一蜂群包含平台管家、集群运维和算子生成三大子系统。平台管家通过自然语言交互,帮助用户统筹AI基座,独立解决80%日常问题;集群运维智能体实现告警自动闭环处置和潜在隐患提前识别,将运维从“人找问题”转变为“问题自己解决”,使运维人效提升5倍以上,关键故障处理效率提升6倍。

算子作为释放硬件性能的最后一公里,其优化难度极大。无问芯穹的高性能算子生成智能体系统KernelMind,通过五步闭环工作流,在真实编译试错中持续自迭代。在GLM5.2模型实测中,该系统在NVIDIA旗舰卡中实现端到端7.3%性能提升,在AMD旗舰卡中更是带来39%的整体性能跃升,全面超越行业基线。

随着AI向物理世界延伸,具身智能成为新的增长极。无问芯穹公布了首个面向大规模具身任务的云边端一体化管理与调度平台,首次将云端GPU集群、边缘算力节点和机器人真机设备统一接入。针对具身智能的大规模真机强化学习训练框架RLinf V0.3,支持真机设备1000+次在线上下线且训练0中断,将近百台真机规模专线需求降至2Gbps以下。同时,全栈推理优化体系Mizar-Robo通过四层协同优化,使端侧推理时延从500ms压缩至70ms,降幅达86%,为机器人产品从实验室走向规模化商用提供了有力支撑。

从算力集散到Token工厂,再到行业赋能及物理世界探索,无问芯穹始终锚定“规模与效率”两大支点。Agentic Infra不仅是技术的集合,更是一种全新的基础设施哲学:用智能进化智能,用生产力加速生产力。在AGI时代,让智能无处不在,需要更加坚实、高效且自主的基础设施支撑。无问芯穹的这一布局,或许正在重塑AI基础设施的未来形态。

















