国产十万卡集群破局:超智融合如何重塑算力基础设施?
中国人工智能算力基础设施正在经历一场静默而深刻的变革。当“十万卡”这个数字从PPT概念走向物理现实,它不仅仅意味着硬件规模的线性叠加,更象征着底层架构范式与工程落地能力的质的飞跃。2026年7月10日,位于郑州的中科曙光宣布,全国产AI超集群曙光8000(登峰)正式落成,并同步接入国家超算互联网,成为全国一体化算力网的关键节点。这一里程碑事件,标志着中国在高端算力领域彻底突破了国外技术封锁,真正迈入了自主可控的“十万卡时代”。
然而,必须清醒地认识到,从万卡集群跨越到十万卡集群,绝非简单的规模扩张,而是一道极具挑战性的系统工程难题。在传统的计算架构中,随着节点数量的指数级增加,通信延迟、存储瓶颈、散热能耗以及任务调度复杂度往往呈非线性爆炸式增长。许多早期集群在规模扩张至万卡级别后,面临的主要痛点正是“网络拥堵”和“资源闲置”。曙光8000的出现,核心突破点在于它并未沿用“堆砌硬件”的传统路径,而是通过架构层面的创新,解决了大规模并行计算中的系统性矛盾。
当前AI算力产业存在一个普遍的结构性错配现象:超算中心擅长高性能科学计算,但难以高效处理大模型训练;智算中心专为AI设计,却在传统科学计算任务面前效率低下。这种“术业有专攻”导致的资源孤岛,使得大量算力资源处于低效运转状态。曙光8000提出的解决方案是“原生超智融合”。这并非将两种计算资源简单拼接,而是在架构设计之初,就将双精度科学计算(FP64)与低精度AI推理/训练(INT8)视为统一的整体进行优化。这种设计使得同一套系统能够无缝切换于高精度科学模拟与大参数模型训练之间,实现了从底层硬件到上层软件的全精度覆盖,极大提升了算力资源的利用率和灵活性。
在工程实现层面,十万卡集群的稳定性取决于全链路的自研能力。曙光8000的成功落地,验证了中科曙光在芯片、计算、存储、网络、散热及管理服务等环节的全面自主可控。底层支撑方面,依托海光等国产高性能处理器,确保了核心算力的安全性与连续性。在网络通信领域,自主研发的scaleFabric类IB原生RDMA高速网络,有效解决了十万级节点间的数据同步瓶颈,实现了高可靠、低延迟的连接。而在数据读写环节,ParaStor分布式存储系统不仅支撑了大模型训练中产生的海量非结构化数据,更在2026年全球IO500榜单中,凭借生产型全节点和10节点性能双双夺冠,证明了其在高并发读写场景下的卓越性能。
能效比是衡量大型算力中心可持续运营的关键指标。面对十万张加速卡带来的巨大功耗压力,曙光数创的液冷技术发挥了决定性作用。通过采用国产冷媒与全年自然冷却方案,曙光8000实现了MW级高功率密度的高效部署。这不仅大幅降低了PUE(电源使用效率)值,使其符合绿色数据中心的高标准要求,更意味着在土地资源紧张的一线城市周边,建设超大规模算力中心具备了经济上的可行性。这种“算力+绿色”的双重优势,为后续算力中心的规模化复制提供了模板。
算力的价值最终体现在应用场景的真实反馈上。曙光8000并未停留在实验室阶段的测试数据,而是迅速投入到了多个前沿科研领域。例如,在生物医药领域,8万张加速卡协同完成了蛋白质折叠全流程模拟,显著缩短了新药研发的验证周期;在高端制造领域,8.8万张卡完成了328万亿网格的湍流直接模拟,为航空与船舶设计提供了高精度数据支持;在天体物理与材料科学中,9万张卡协同完成了3.16万亿原子的DFT高精度仿真。这些案例表明,国产算力已经完全具备了解决世界级科学难题的能力,且不再依赖特定的封闭生态,而是通过开放的AI计算架构,兼容多品牌加速卡,降低了开发者的迁移成本。
值得注意的是,曙光8000的落成并非孤立事件,而是国家算力网络战略布局中的重要一环。选址郑州,兼具区位枢纽优势与能源成本优势,使其成为连接东部数据需求与西部能源供给的理想节点。随着该集群接入国家超算互联网,其算力资源正以服务的形式向全国科研机构及产业界开放。目前,已有300余项应用完成适配,覆盖材料、电磁、量子计算、天文气象等20多个领域。这种“算力即服务”的模式,打破了资源地域限制,让偏远地区的科研机构也能享受到顶级算力支持,真正实现了算力的普惠化。
更为深远的意义在于产业链的协同效应。曙光8000的成功,证明了国产全栈技术路线的可行性,增强了上下游企业的信心。在大洋彼岸,算力竞争已不仅仅是单一厂商的技术比拼,而是整个生态系统的全方位对抗。曙光8000采用开放架构,允许不同品牌的AI加速卡接入,这种包容性策略有助于形成多元共生的产业生态,避免单一供应商锁定风险。与此同时,中科曙光与北京科学智能研究院达成战略合作,启动第二套全国产十万卡系统的研制,表明该技术路线已进入标准化、可复制的快速推广阶段。
展望未来,中国算力发展的核心命题已从“有没有”转向“好不好用”以及“如何流动”。东数西算工程与国家超算互联网的推进,旨在构建一个像电网一样稳定、像互联网一样开放的全国性算力调度网络。曙光8000作为首个十万卡级节点,其意义在于验证了超大规模集群在真实生产环境中的稳定性与经济性。当更多此类节点在全国铺开,中国将织就全球规模最大、调度最灵活的算力网络。
这一进程并非一帆风顺。如何进一步优化跨域算力调度的算法,如何提升异构硬件间的兼容效率,如何降低中小企业的算力使用门槛,仍是需要持续攻克的课题。但可以预见,随着国产算力基础设施的不断完善,中国在人工智能、基础科学研究及高端制造等领域的核心竞争力将迎来新一轮跃升。曙光8000的落成,只是一个开始,它昭示着一个由自主算力支撑的创新时代的到来,在这个时代,中国将不再仅仅是算力技术的跟随者,而是规则的制定者与标准的引领者。对于整个科技行业而言,这不仅是硬件的胜利,更是系统工程能力与产业协同思维的全面胜利。