打破英伟达垄断?国产GPU直通RDMA网卡实测:吞吐飙升延迟减半

4 阅读

算力互联的新转折点:从单点突破到系统协同

随着人工智能大模型训练参数量的指数级增长,算力基础设施的竞争焦点正在发生深刻转移。过去,行业往往聚焦于单颗芯片算力的极限压榨,但在面对万亿参数模型的训练需求时,这种单一维度的优势已显得力不从心。当前国产算力产业面临的核心困境,并非单芯片性能的绝对落后,而是“单点强、系统弱”的结构性失衡。片内、片间、网间以及集群间的互联体系各自为政,缺乏统一的全栈视角,导致算力资源被严重碎片化,系统级性能无法随芯片数量的增加而线性释放。

在这一背景下,网络互联不再仅仅是连接各组件的辅助手段,而是决定整体效能的核心命脉。2026世界人工智能大会(WAIC 2026)提供了一个观察这一转变的绝佳窗口。作为国内领先的AI网络全栈式互联产品供应商,奇异摩尔在此次会议上首次公开亮相,并推出了一套涵盖从Scale-Out网间互联、Scale-Up超节点XPU间互联到下一代光互联的全栈解决方案。这不仅是一次产品展示,更标志着国产AI算力基础设施从“单点芯片突破”向“系统级协同优化”的跨越式发展。行业专家指出,连片成林方能御风,只有打破算力孤岛,将单个强点连成高效系统,才能真正释放国产算力的潜力。

IBGDA实测:国产GPU直通国产网卡的性能跃升

在复杂的MoE(混合专家模型)训练或推理场景中,专家并行通信涉及两个核心阶段:Dispatch(分发)和Combine(合并)。这两个阶段都伴随着海量的小粒度数据交换。在传统架构中,GPU需要经由CPU中转指令,这不仅产生了额外的延迟,还占用了宝贵的CPU资源,严重制约了GPU并行计算吞吐优势的发挥。

为解决这一痛点,IBGDA(In-Band Gateway Data Access)技术应运而生。它允许GPU直接发起通信,绕过CPU处理环节,从而显著降低指令中转等待时间。在国际市场上,英伟达凭借GPU与ConnectX系列网卡的深度协同,率先实现了成熟的IBGDA方案。然而,对于国产集群而言,实现同等能力面临巨大挑战:国产GPU不仅需要支持类NVSHMEM编程及最新的NCCL通信库,还需在软硬件层面与国产RDMA网卡完成深度适配。

此次奇异摩尔与壁仞科技联合展示的IBGDA Demo,打破了这一僵局。该方案基于奇异摩尔的单通道400G RDMA ASIC引擎,兼容专为MoE模型优化的集合通信库,并原生支持IBGDA机制。实测结果显示,相较于传统的IBRC方案,IBGDA在小包、高频、强同步场景下展现出了代际优势。具体而言,单次小消息带宽显著跃升,原始小包发送及合并发送的吞吐量均实现了质的跨越。更为关键的是,All-to-All通信延迟大幅缩短,接近翻倍提升。传统方案中因小消息带来的时延远高于大消息的“小包惩罚”现象被彻底消除。这一成果证明了国产算力生态已具备底层互通和系统级协同优化的实战能力,为大规模国产AI推理集群提供了兼具高性能与自主性的网络选择。

光互联演进:CPO与芯粒技术的深度融合

除了电互联技术的突破,光互联作为下一代超节点系统的基石,其战略意义同样深远。传统电互联受限于铜缆的物理极限,带宽密度与能耗已难以支撑未来的算力需求。相比之下,光互联在Scale-Up空间内几乎没有通信距离焦虑,能够有效缓解单节点I/O能力对系统扩展的制约。

光互联的演进路径清晰可见:从可插拔光模块,到NPO(近封装光学),再到CPO(共封装光学),最终目标是实现“光内生”,即把光互联功能直接集成于计算芯片内部。路径越短,收益越显著:不仅省去DSP组件以降低延迟和功耗,还能简化系统设计,提升整体算力利用率。然而,CPO技术主要解决物理层的高速数据传输问题,协议层的复杂网络拓扑与流控机制仍对计算核心造成巨大负担。

为此,I/O芯粒(Chiplet)的出现补齐了这一短板。它扮演着语义对齐与协议承载的核心接口角色。奇异摩尔基于长期积累,前瞻性地布局了OSU(Optical Scale-Up)IO芯粒产品与未来CPO迭代方案的融合路径。在大会上,奇异摩尔携手图灵量子、奇点光子等合作伙伴,展示了直连NPO光互联测试板。该方案搭载了内部集成独立芯粒的主芯片,以及定制化的NPO进封装引擎,旨在突破互连速率与距离瓶颈,提升智算节点规模与计算能力。

此外,由香港科技大学(广州)发起,奇异摩尔联合曦望科技、壁仞科技等单位共同编写的《共封装光学(CPO)技术白皮书》正式发布的,系统梳理了CPO的技术路径与产业挑战,为国内光互连技术的标准化落地与产业化发展提供了权威指引。

生态共建:打破碎片化,共筑自主可控底座

超节点已成为下一代智算基础设施的核心形态,其竞争维度已从单一芯片性能拓展为多变量的系统级协同。大模型训练侧的Scaling Law、推理侧的test-time scaling以及Agent应用带来的调用量爆发,共同驱动着算力需求的指数级增长。这些需求叠加在一起,远非单芯片能力提升所能独自承接,真正决定格局的在于互联、整机、软件和系统协同。

尽管国内多家厂商已推出各自的超节点方案,但体系架构定义、Scale-Up互联协议、软硬协同优化及集群RAS能力等方面的碎片化挑战依然存在,甚至隐藏着“卡脖子”风险。单打独斗难以破局,唯有产业链上下游开放协同,才能真正把国产智算集群“用起来、跑得好、立得住”。

基于这一行业共识,在WAIC 2026期间,上海市算力网络协会、上海人工智能实验室、中国信息通信研究院华东分院正式发起“国产超节点生态共建倡议行动”。中兴通讯、壁仞科技、沐曦、天数智芯、燧原科技、商汤科技、曙光信息等产业链重量级企业共同参与。这一倡议标志着国产超节点生态正加速凝聚产业共识,旨在汇聚各方优势资源,共同制定开放、兼容的超节点互联标准,打破技术孤岛,推动国产算力网络在系统级协同上迈出实质性一步。

奇异摩尔在此次大会上展示的纯国产化超节点互联全栈方案、基于OISA协议超节点卡间互联验证平台等核心展品,以及发起生态共建倡议,展现了其“技术+生态”双轮驱动的战略决心。随着超节点架构逐步成为AI算力的主流形态,互联技术将跃升为决定系统效能的关键引擎。中国AI算力基础设施的自主可控与持续升级,正在这套系统级协同方案的推动下,迎来新的历史机遇。