十万卡集群落地:国产算力如何实现超智融合的底层逻辑?

0 阅读

跨越十万卡门槛:从堆叠数量到系统工程的重构

中国人工智能算力基础设施的发展轨迹,正在经历一次从量变到质变的剧烈跃迁。7月10日,在郑州,中科曙光正式宣布全国产AI超集群曙光8000(登峰)落成,并依托国家超算互联网同步接入全国一体化算力网。这一事件标志着国产算力正式迈入“十万卡时代”,但这不仅仅是硬件规模的简单累加,更是一场关于系统工程能力的极限测试。

从万卡集群到十万卡集群,看似只是数量级上的翻倍,实则是工程复杂度的指数级跳跃。在如此庞大的规模下,系统面临的挑战不再是单一的性能提升,而是如何确保十万张加速卡在高速互联中不出现网络拥堵,在海量数据吞吐下存储不崩塌,在高密度部署中散热不失效,以及在跨任务调度时系统不混乱。这种系统级的稳定性要求,远超此前任何单机或多节点集群的工程标准。

值得注意的是,曙光8000并未选择传统的“堆卡”路线,而是试图解决当前AI算力中心普遍存在的结构性错配问题。长期以来,超算中心擅长处理高并发的科学计算任务,而智算中心专注于人工智能训练,两者往往割裂运行,导致资源闲置或效能低下。曙光8000提出的“原生超智融合”理念,旨在通过统一的底层架构,同时承载FP64双精度科学计算和万亿参数大模型训练需求,实现全精度覆盖。这一突破,为国产算力资源的优化配置提供了一条具有现实可行性的技术路径。

原生超智融合:打破超算与智算的壁垒

在理解曙光8000的技术价值之前,我们需要审视当前算力基础设施面临的痛点。行业内普遍存在一种尴尬现象:专门构建的智算集群难以胜任高精度的科学计算任务,而传统的超算中心在运行大模型训练时又显得力不从心。这种“两头不靠”的资源错配,造成了巨大的算力浪费。

曙光8000给出的解决方案是“原生超智融合”。这并非简单地将超算与智算资源拼接,而是在架构设计之初,就将两种计算范式视为一个整体进行优化。这就好比修建一条道路,过去的思路是为重型卡车和轻型轿车分别铺设专用车道,而现在的思路是修建一条能够同时高效承载两类车辆混合通行的复合型道路。虽然表面都是路网,但底层的逻辑设计截然不同。

具体而言,曙光8000从FP64到INT8实现了全精度的无缝覆盖。这意味着同一套硬件平台,既能应对材料科学、电磁仿真中需要极高精度的双精度运算,也能满足大模型训练中大量的低精度矩阵乘法需求。作为业内首个基于原生超智融合路线打造、支持全精度计算的十万卡级案例,曙光8000通过构建“超智融合”平台,将分散的超算中心与智算中心资源池化。这种架构使得跨平台、跨架构的统一调度成为可能,从而极大提升了国产算力的整体利用率,降低了重复建设的成本。

这种架构创新的意义在于,它不再依赖特定应用的适配,而是从硬件底层提供通用的计算能力。对于科研机构和企业而言,这意味着无需为了不同的计算任务购买两套截然不同的硬件设施,只需在一个统一的平台上部署相应的软件栈即可。这种通用性,正是构建国家级算力枢纽所必需的基础特征。

全链路自主可控:工程奇迹背后的技术底座

十万卡集群的落成,不仅是架构设计的胜利,更是工程制造能力的集中体现。回顾其发展历程,2024年启动系统研制,2025年完成工程建设,2026年2月3万卡上线试运行,4月投用6万卡AI4S集群,直至7月全面部署落地10万卡。这一令人瞩目的进度,源于中科曙光三十多年在高性能计算领域的深厚积淀。

据中科曙光高级副总裁李斌介绍,曙光8000实现了芯片、计算、存储、网络、散热、管理、服务等全链路全国产自研。这一全栈自研能力是保障供应链安全和技术可控性的关键。在底层硬件层面,海光等国产芯片提供了坚实的算力支撑,确保了核心处理单元的自主可控。

在网络互联方面,曙光采用了基于ScaleFabric的类IB原生RDMA高速网络。在十万卡规模下,节点间通信的频率和带宽需求极高,任何微小的延迟或丢包都可能导致训练效率大幅下降甚至任务失败。ScaleFabric网络通过优化数据传输路径和协议,实现了高可靠、低延迟的连接,解决了大规模集群通信的瓶颈问题。

存储系统同样面临巨大挑战。ParaStor分布式存储系统在支持大模型训练和科学计算中的海量数据读写方面表现优异。在2026年全球IO500榜单中,曙光ParaStor不仅获得了生产型全节点性能第一,还在10节点性能榜单中位列第一。这一成绩证明了其在极高吞吐量场景下的处理能力,能够跟上计算单元的速度,避免存储成为系统短板。

此外,散热问题在MW级高功率密度部署中尤为突出。曙光数创提供的液冷技术核心优势,通过国产冷媒和全年自然冷却方案,大幅提升了系统的能效比。这不仅降低了运营电费,还延长了硬件的使用寿命,使得十万卡集群在长期运行中保持稳定性和经济性。

从实验室到产业化:算力价值的真实兑现

技术参数的堆砌只是起点,算力的终极命题在于“用好”。AI产业有一个被反复验证的规律:发布会上的演示永远跑不赢业务现场的考验。曙光8000的价值,更体现在其已在真实场景中交出的成绩单。

目前,曙光8000已完成300余项应用适配,覆盖材料、电磁、量子、生物医药、天文气象等20多个领域,累计完成70余次万卡规模算力测试。这些数据背后,是具体的科研突破和产业应用。例如,利用8万张卡加速蛋白质折叠全流程模拟,直接服务于新药研发,大幅缩短了药物筛选周期;利用8.8万张卡完成328万亿网格湍流直接模拟,为航空、船舶等高端制造领域的流体动力学分析提供了高精度数据支撑;利用9万张卡协同完成3.16万亿个原子的DFT(密度泛函理论)高精度仿真,推动了新材料的发现与研发。

这些成果并非PPT上的数字游戏,而是科研团队在国产算力平台上跑出来的世界级突破。它们证明了国产十万卡集群不仅“跑得通”,而且“跑得快”、“跑得准”。更重要的是,曙光8000采用了AI计算开放架构,支持多品牌AI加速卡,兼容主流生态。这一开放性策略至关重要,它意味着一线开发者和科研人员无需重新学习一套封闭的工具链,已有的模型和应用可以快速迁移上线。

开放的另一个深远影响是,它让整个产业链都能参与进来,而非由单一厂商独自表演。这种生态兼容性,有助于形成健康的产业循环,促进软件生态的丰富和应用场景的拓展。通过兼容主流生态,曙光8000降低了用户的使用门槛,加速了人工智能技术在垂直行业的渗透。

算力网络布局:从郑州节点到全国一张网

曙光8000落子郑州,并非随机选择,而是基于对国家算力网络战略布局的深刻理解。东数西算、全国一体化算力网、国家超算互联网,这些顶层设计的核心目标都是实现算力的像电力一样流动和高效配置。

郑州作为中部地区的交通枢纽,拥有独特的区位、能源条件和网络节点地位。在这里部署十万卡级集群,使其天然适合成为连接东部数据需求和西部算力资源的枢纽。这一布局意味着国家算力网的骨干节点具备了承载超大规模计算任务的能力,为跨区域、跨层级的算力调度提供了物理基础。

中科曙光已同步将曙光8000接入国家超算互联网,以算力服务的方式向科研机构和产业界开放。这不仅提升了集群自身的利用率,更将其转化为公共基础设施,服务于更广泛的社会创新。大会期间,中科曙光与北京科学智能研究院达成战略合作,正式启动第二套全国产十万卡超智融合算力系统研制与建设。这一动作表明,曙光8000正在从一个示范工程,走向可复制的标准方案。

当更多十万卡级节点在全国铺开,中国将率先织成全球最大规模的算力调度网络。这种网络效应将彻底改变算力的供给模式,使得偏远地区的科研机构也能随时调用强大的计算资源。登峰之后,真正值得看的风景,是这张无处不在、流动灵活的算力网络,以及它所催生的新一轮科技革命和产业变革。

曙光8000的落成,不仅是中国算力硬件的一次胜利,更是软件生态、系统集成、网络调度全方位能力的综合展现。它证明了在高端算力领域,中国已经具备了独立构建超大规模基础设施的能力。未来,随着更多类似集群的上线和应用场景的深化,国产算力将从“可用”走向“好用”,最终成为推动社会进步的核心引擎。这一进程,才刚刚开始。