国产算力破局:商汤如何把负毛利做成25倍增长的正向生意?

0 阅读

在人工智能基础设施的演进历程中,算力往往被视为一种高投入、低回报的重资产业务。长期以来,业内流传着一句看似不可违背的行业定律:购买或使用国产高端算力芯片,意味着必须承担较高的边际成本,甚至陷入“谁买谁认亏”的困境。然而,随着2026年AI应用爆发式增长,特别是Agent类应用对长上下文和实时推理需求的激增,这一传统认知正在被重新定义。商汤大装置在这一周期内交出的成绩单显示,其国产芯片相关业务的毛利率已成功转正,且日均Token处理量从年初的4000亿飙升至2.42万亿,年底目标直指10万亿,实现了约25倍的增长。这一反转并非偶然,而是源于其在一套系统性方法论上的长期深耕与精细化运营。

要理解这一商业模式的突破,首先需审视当前国产算力面临的结构性矛盾。虽然国内大模型的算法水平与国际主流已无明显代际差距,但底层硬件,特别是高性能GPU,仍落后于全球顶尖水平约一代。这种软硬件的错位,如果仅依赖硬件迭代,周期过长且成本高昂。商汤大装置选择的策略是“先拼系统,再等芯片追上来”。通过系统层面的深度优化,弥补硬件性能的短期不足,成为其核心竞争力的来源。这种思路将算力供给从单纯的硬件采购,转变为一种可组合、可调度的系统工程。

这套系统的核心技术支柱是“异构混合推理”。在大型语言模型的推理过程中,Prefill(预填充)和Decode(解码)两个阶段对硬件资源的需求截然不同。Prefill阶段主要是一次性吞入输入内容,算力密集度高,但显存带宽压力相对较小;而Decode阶段则是逐字生成输出,需要频繁访问显存中的KV Cache,对显存带宽极其敏感。商汤通过这种认知,将任务解耦,把对带宽要求极高的Decode环节分配给性能更强的高端资源,而将算力需求分散的Prefill环节分配给数量更多的通用国产芯片。这种“高低搭配”的策略,使得一块高端芯片能够带动约30块国产芯片协同工作,在不显著降低体验的前提下,大幅降低了单位成本。

这种架构的落地并非易事,它要求系统具备极高的灵活性和兼容性。商汤大装置在此前积累了深厚的技术底座,前后适配了20多款不同厂商的国产芯片,其中已有六七款实现了稳定的商业化盈利。为了最大化这些异构资源的效能,团队在编译器适配、算子重写、框架对接以及调度策略等多个层级进行了定向优化。这些看似琐碎的工作,实际上极大地压榨了国产芯片的算力利用率。数据显示,通过异构混合推理,主流国产芯片的MFU(模型浮点运算利用率)提升了85%-152%。换算成商业指标,这意味着单位成本的Token产出提升了2.5倍。在具体场景中,如AI4S领域的长序列蛋白质预测,通过融合算子优化,整体预测耗时减少了75%;在AIGC视频生成场景中,国产芯片运行DiT模型的多卡并行加速比达到了93%。

除了技术层面的突破,商汤大装置的另一个关键优势在于“端到端整合”的运营模式。在传统的IT产业链中,机房建设、硬件采购、运维服务和最终交付往往分散在不同公司手中。这种细化的分工虽然提高了各环节的专业度,但也带来了巨大的协同摩擦成本。一层级的浪费往往难以在另一层级得到补偿,导致整体效率低下。商汤大装置选择了一条更为艰难但高效的路径:自建机房、自采硬件、自研调度系统、自有服务团队。这种“包圆”式的打法,最早源于适配国产芯片时对底层技术的掌控需求。自2018年起,商汤便组建了涵盖研发团队、芯片原厂和高校科研机构的协作体系,通过“松耦合与紧耦合并存”的方式,解决了从底层编译器到上层应用的全链条技术难题。

在这一体系中,最新引入的AI自动生成算子适配代码技术,进一步提升了工程效率。过去需要工程师手工完成的适配工作,现在由AI接管,大幅压缩了跟随模型迭代所需的人力时间成本。这种端到端的整合能力,不仅体现在计算资源上,还延伸至能源管理。商汤大装置发布了“算电协同Agent”,将算力任务与电力调度联合优化。通过预测算力任务的耗电特征,结合峰谷电价和储能设施,调节整体用电节奏,使得单位电力成本的Token产出提升了80%左右。这一创新指标TPW(每瓦特Token数),揭示了算力经济性背后的另一重维度——能源效率。

这种方法论的外延,正在推动国产AI基础设施生态的共建。商汤联合了寒武纪、沐曦股份、中科海光、华为昇腾等近20家生态伙伴,发起国产AI基础设施生态共建计划。其目标不仅仅是提供算力服务,更是构建一个开放共享、联合创新的产业平台。依托“银河计划”,商汤计划未来建设1个Token运营中心、5个万卡级国产智算集群,并围绕10个核心技术方向进行联合创新,赋能200家AI初创组织。这种生态聚合能力,使得商汤大装置能够从单一的服务提供商,转变为产业基础设施的标准制定者和生态组织者。

此外,算力布局的视野也在向太空延伸。商汤大装置与国星宇航签约,探索从地面万卡集群到在轨多星协同的太空算力合作。这一布局瞄准的是地面集群无法覆盖的弱网络环境,如应急救灾、远洋船舶和野外机器人等场景。预计到2026年,“商汤号”系列算力卫星将完成首发并组网,验证星地协同计算能力;到2030年,将建成天地一体化的AI算力星座。这种前沿探索,不仅是技术上的创新,更是对未来算力空间形态的前瞻性定义。

尽管当前的高毛利和高增长得益于供需失衡的市场窗口期,但商汤大装置所沉淀的方法论具有长期的生命力。随着算力供给端的逐步追赶,单纯的价格红利可能会收窄,但系统整合能力、跨场景复用能力以及生态协同能力,将成为构建长期护城河的关键。模型应用场景的日益多样化,如具身智能、世界模型和科学计算,对算力提出了差异化甚至相互冲突的要求。单一芯片架构很难通吃所有场景,这为擅长“组合调度”的玩家留出了广阔的发展空间。

在这场AI基础设施的竞赛中,芯片的先进性固然重要,但如何将有限的资源拼成最优组合,以最低的成本、最高的效率满足多样化的算力需求,才是决定胜负的关键。商汤大装置通过九年的布局,证明了一条可行的路径:通过端到端的系统优化和生态整合,国产算力不仅可以实现商业上的正向循环,更能在激烈的市场竞争中建立起独特的竞争优势。随着技术瓶颈的突破和生态体系的完善,这套方法论将在更广泛的领域产生深远影响,推动中国AI产业从“跟随”走向“引领”。