十万卡集群落地:国产算力如何破解规模与能效的双重悖论?
中国人工智能算力基础设施正经历一场从量变到质变的深刻重构。7月10日,在郑州,中科曙光宣布全国产AI超集群曙光8000(登峰)正式落成,并依托国家超算互联网,同步接入全国一体化算力网。这一里程碑事件不仅意味着中国拥有了一座容纳十万张国产加速卡的超级算力引擎,更标志着我国在构建自主可控、高效能的算力底座方面取得了突破性进展。从万卡到十万卡,这不仅仅是数量级的线性增长,而是一道涉及系统工程、网络架构、热管理以及软件调度的复杂非线性方程。在这场技术攻坚中,曙光8000提供的答案并非简单的硬件堆叠,而是对算力底层逻辑的重塑。
传统AI算力中心长期面临着“结构性错配”的困境:专门建设的智算集群往往难以胜任需要高双精度计算能力的科学计算任务,而传统的超算中心在应对千亿参数大模型训练时又显得力不从心。这种“两头不靠”的资源闲置现象,造成了巨大的基础设施投资浪费。曙光8000提出的解决方案是“原生超智融合”。这并非将超算与智算简单拼接,而是在架构设计之初就将两者视为一个整体。从FP64双精度科学计算到INT8低位宽AI推理,系统实现了全精度的无缝覆盖。这种设计逻辑类似于建造一条既能承载重型卡车又能通行高速轿车的通用道路,而非分别修建两条专用车道,从而在物理底层实现了算力资源的最大化共享与灵活调度。
攻克十万卡规模的技术壁垒,核心在于解决“规模效应”带来的负外部性。随着节点数量呈指数级增长,网络延迟、存储带宽瓶颈以及散热功耗问题会急剧恶化。曙光8000之所以能创下单月部署10万卡的历史纪录,得益于其中科曙光在系统工程领域三十多年的深厚积淀。该系统实现了芯片、计算、存储、网络、散热、管理及服务的全链路全国产自研。底层由海光等国产芯片提供算力支撑,确保了供应链的安全可控;网络层面,ScaleFabric类IB原生RDMA高速网络解决了十万卡集群间的高可靠低延迟连接问题,避免了“网络堵死”导致的算力空转;存储方面,ParaStor分布式存储在大模型训练的海量数据读写场景中表现出色,并在2026全球IO500榜单中斩获生产型全节点和10节点性能双榜第一,证明了其在极端并发下的稳定性。
在能耗方面,高功率密度部署一直是大型算力中心的痛点。曙光8000依托曙光数创的液冷技术核心优势,采用了国产冷媒及全年自然冷却方案,有效应对了MW级高功率密度的散热需求。这一举措不仅大幅提升了系统的能源效率(PUE),降低了运营成本,更符合国家“双碳”战略下绿色数据中心的发展趋势。值得注意的是,这种强大的工程能力并非用于封闭自嗨,而是通过开放的架构面向科研机构和产业界提供服务。目前已完成的300余项应用适配,覆盖材料科学、电磁仿真、量子计算、生物医药、天文气象等20多个领域,累计完成70余次万卡规模算力测试,验证了其在真实科研场景中的可靠性与泛化能力。
算力的终极价值不在于跑分数据,而在于解决实际问题。曙光8000已在多个前沿领域交出了实质性的成绩单。例如,利用8万张加速卡进行蛋白质折叠全流程模拟,直接加速了新药研发周期;利用8.8万张卡完成328万亿网格的湍流直接模拟,为航空发动机、船舶设计等高端制造业提供了高精度的流体动力学仿真支持;利用9万张卡协同完成3.16万亿个原子的DFT高精度仿真,推动了材料科学的底层突破。这些成果表明,国产算力已从“可用”迈向“好用”,能够支撑世界级的大科学装置和大模型训练任务。
此外,曙光8000采用的AI计算开放架构,支持多品牌AI加速卡接入,兼容主流软件生态。这一开放性策略打破了技术垄断,降低了开发者和科研人员的迁移成本,使得现有的模型和应用能够快速部署上线。开放的生态意味着整个产业链能够共同参与技术迭代,而非依赖单一供应商,这有助于形成健康、可持续的产业循环。大会期间,中科曙光与北京科学智能研究院达成战略合作,启动第二套全国产十万卡超智融合算力系统的研制与建设,标志着曙光8000正从单一的示范工程走向可复制、可推广的标准解决方案。
从宏观战略视角来看,东数西算、全国一体化算力网以及国家超算互联网的顶层设计,核心目标均是实现算力像电力一样自由流动与按需分配。曙光8000落子郑州,具有深远的战略考量。郑州作为国家综合交通枢纽,其区位交通优势、能源成本优势以及网络节点地位,使其成为连接东西部算力资源、平衡区域发展的理想枢纽。十万卡级节点在此落地,意味着国家算力网的骨干网络获得了强大的承载能力,能够高效调度周边乃至全国的算力资源。
当更多十万卡级节点在全国范围内铺开,中国将构建起全球规模最大的算力调度网络。这一网络不仅服务于当前的AI热潮,更为未来量子计算、通用人工智能等前沿技术的爆发储备了基础设施。曙光8000的落成,是中国在突破关键技术封锁、构建自主算力生态方面的关键一步。它证明了中国有能力在极端规模下,通过架构创新与工程优化,解决算力规模化带来的复杂工程难题。
未来,随着全国一体化算力网的进一步完善,算力资源的跨域调度将更加智能高效。曙光8000所代表的“超智融合”路径,为后续算力中心建设提供了重要的参考范式。它提醒业界,算力竞争的下半场,不再是单纯的硬件参数比拼,而是对系统整体效能、生态兼容性以及应用场景深度的综合较量。在中国迈向科技强国的进程中,算力作为新的生产力要素,其自主可控与高效利用,将是决定国家未来竞争力的核心基石。曙光8000的启航,正是这一宏大叙事中浓墨重彩的一笔,它不仅是一座数据中心,更是中国算力迈向全球领先行列的重要路标。