十万卡集群落地:国产算力突破技术瓶颈后的商业化大考

5 阅读

随着2026年7月国内首个全国产十万卡AI超集群——曙光8000(登峰)在郑州正式落成并接入国家超算互联网,中国算力基础设施的建设迈入了一个全新的量级。这不仅是硬件数量的简单叠加,更是一场涉及芯片、服务器、交换机及网络架构的全栈国产化工程突围。截至2025年底,全国已建成的万卡智算集群达到42个,但十万卡集群此前并无先例。这一里程碑式的落地,宣告了国产算力在超大规模系统组织与稳定性控制上的能力跃升,然而,真正的考验才刚刚开始。

超大规模系统的非线性挑战

在公众视野中,十万张AI加速卡同时运转往往被简化为算力的极致堆叠。然而,在系统架构师的视角下,从万卡到十万卡的跨越,绝非简单的十倍线性增长,而是一次几何级数的工程难度跃迁。中科曙光高级副总裁李斌曾以交响乐演出作比:十万人同时演奏,若缺乏统一的指挥、乐谱与默契配合,发出的声音将是嘈杂的噪音,而非和谐的乐章。

十万卡集群的核心痛点在于系统复杂度的指数级上升。任何一个计算节点、互联链路或调度环节的微小瑕疵,在如此巨大的规模下都会被无限放大,导致整体性能坍塌。传统算力集群在万卡规模以下尚能维持稳定,但在十万卡量级,技术短板会被极端暴露。因此,曙光8000的突破点在于解决“协同”问题,即如何让十万个独立的计算单元精确合奏。

为此,曙光构建了scaleFabric高速互连网络。该网络采用类InfiniBand的原生RDMA技术,旨在支撑十万卡集群的稳定连接,并具备毫秒级的链路故障恢复能力。在工程实现上,为了追求极致的稳定性,系统在柜级单元内优先采用铜互联而非光互联。尽管铜的物理传输距离受限,但其信号质量更优、故障率更低,仅在物理距离超过铜驱动极限时才转向硅光共封装(CPO)技术。这种基于可靠性的工程取舍,反映了在超大规模下,稳定性优于极致性能指标的务实逻辑。

此外,元器件数量的十倍增长意味着故障概率的算术级上升。曙光采取的策略是将每个小部件到板卡的可靠性提升至通用计算设备的一个数量级。配合浸没式液冷技术以控制温度波动,这套体系确保了集群在长时间高负载下的持续运行。这种对系统稳定性的极致追求,证明了国产算力已具备将超大规模算力组织、运行并开放服务的能力,这是AI应用竞争的真正入场券。

“超智融合”架构的结构性优势

曙光8000的另一大技术突破在于其“原生超智融合”架构。在传统算力部署模式中,科学计算与AI训练通常被划分为两套独立的系统。科学计算依赖FP64双精度浮点运算,要求极高的计算精度;而大模型训练则主要依赖FP16甚至INT8低精度大吞吐计算。两套系统的分离部署,不仅增加了基础设施的投入,更导致了数据在不同系统间搬运时的高昂时间成本与配置复杂度。

这种结构性分离导致了一个长期存在的困境:传统超算“够精准但不够智能”,难以适配快速迭代的AI算法;传统智算“够灵活但精度不足”,无法支撑严谨的科学仿真。曙光8000通过底层芯片到系统架构的一体化设计,实现了从FP64到INT8的全精度计算支持。这意味着同一套系统既能承接传统超算的高精度工程任务,又能支撑大模型训练和智能体推理,真正实现了“1+1>2”的效果。

以药物研发为例,研究团队在分子动力学模拟时需调用超算资源,而在训练AI预测模型时又需切换至AI集群。数据迁移、格式转换和重新配置往往消耗大量时间。超智融合架构消除了这一壁垒,使得科学计算与AI训练可以在同一系统内无缝衔接。在实际应用中,8万张卡完成了蛋白质折叠全流程模拟,将耗时数年的任务压缩至数周;9万张卡完成了3.16万亿原子的DFT高精度仿真;8.8万张卡完成了328万亿网格的湍流直接模拟。

值得注意的是,在这些大规模应用中,结合机器学习深度学习与传统数值计算的案例比例远超预期。这表明国内头部应用团队正在快速采纳AI方法加速科研进程。对于中国而言,这种不同于单纯追赶单点算力规模的路径,通过全国一体化算力网和算电协同机制,探索出了一条具有中国特征的基础设施发展路径。

商业化闭环与利用率焦虑

十万卡集群的落成虽然技术意义非凡,但其核心价值最终需通过商业可持续性来验证。中国科学院院士鄂维南曾指出,算力规模本身不是目的,能否让算力真正“可用”才是关键。当前行业热议的“算力泡沫”,本质上是对算力价值落地难的焦虑。市场闲置的多是低端通用算力,而适配AI for Science、高端工业仿真及大模型深度训练的大规模国产优质算力,仍处于供不应求的状态。

然而,从“可用”到“好用”,再到“有利可图”,中间横亘着三道难关。首先是软件工程化能力与硬件规模的匹配问题。业界广为人知的案例显示,即便拥有数十万张GPU,模型浮点运算利用率仍可能低至11%。当十万张卡静置时,若软件系统无法有效调度,硬件优势将化为乌有。这不仅是硬件采购问题,更是分布式系统调度、算法优化及开发工具链建设的系统工程。

其次是推理需求的增长能否持续消化新增供给。虽然Token调用量在攀升,但模型效率的提升导致单位Token的算力消耗迅速下降。算力供给扩张与模型效率优化之间的赛跑结果尚不确定。特别是在2026年智能体应用全面爆发、AI产业进入推理时代的背景下,海量实时交互、超长上下文推理及产业常态化应用确实凸显了大规模算力的刚需属性,但这一需求的持续性与增长曲线仍需观察。

最后是运营成本与商业闭环的平衡。十万卡集群的电力消耗、液冷维护及运维人力成本极其高昂。如果算力服务单价持续走低,而运营成本难以同步下降,商业模型的可持续性将面临挑战。曙光已与北京科学智能研究院合作启动第二套十万卡系统的研制,这一决策速度体现了对技术路线的信心。但从“示范工程”走向“商业可复制”,还需在降低全生命周期成本、提升软件利用效率及拓展多元化应用场景上持续深耕。

国产算力“出息了”,不仅体现在硬件参数的突破,更体现在系统级能力的成熟。十万卡集群的落地,为中国AI基础设施提供了一条通过系统优化弥补单点差距、通过融合架构提升综合效能的新路径。未来,竞争的关键将不再仅仅是卡的数量,而是如何将庞大的算力转化为高效、稳定且具备经济价值的智能服务。这一过程,既是技术的演进,也是商业模式的深刻重构。