Kimi停售背后:算力供需重构与光互连产业的深层逻辑
近期,月之暗面发布的一则关于算力紧缺与会员暂停开放的公告,在科技圈引发了广泛讨论。这并非简单的商业策略调整,而是大模型行业进入深水区的一个标志性信号。当Kimi K3上线仅48小时便逼近集群承载极限,不得不暂停C端新用户订阅时,市场对于“算力过剩”的质疑声戛然而止。与此同时,阿里千问宣布Qwen3.8即将开源,参数规模达到2.4万亿,进一步印证了模型大型化的趋势。这一系列事件背后,隐藏着当前大模型推理算力供需逻辑的根本性转变,值得深入拆解。
许多用户抱怨Kimi K3“贵”且“慢”,但这与它被抢购至停售的现象形成了鲜明反差。这种矛盾揭示了用户感知与底层技术成本之间的错位。从表面看,K3的输出定价约为上一代的4倍,输入和输出价格分别为每百万Token 3美元和15美元,看似具有价格优势。然而,若从完成特定任务的整体成本来看,情况则大不相同。第三方评测数据显示,运行同一套智力测试,K3输出的Token数量是可比推理模型中位数的两倍以上。这意味着,虽然单价较低,但总账单并未显著下降,甚至因对话冗长而增加了用户的日常体感成本。
更关键的是,包括Kimi、Qwen以及DeepSeek在内的多家头部厂商,纷纷采取了限流、拆分权益或峰谷定价等措施。这表明,最强的智能资源目前正处于“按份供应”的状态。算力不再是无限供给的基础设施,而是成为了稀缺的战略资源。市场此前曾预期中国模型将通过极致优化实现“省算力”,从而引发类似DeepSeek时刻的硬件需求下滑,但K3的停售公告有力地反驳了这一观点。事实表明,算力的需求不仅没有减少,反而因模型形态的演变而变得更加刚性。
要理解这一现象,必须深入探究K3低价背后的技术前提。我们可以将大模型推理系统比作一座货运园区,Token是包裹,推理过程是分拣与派送,显卡是工位,而高速互连网络则是传送带。K3实现低成本主要依靠三招:稀疏激活、缓存分离和数据压缩,但这三招无一不依赖于强大的网络通信能力。
首先,稀疏激活技术使得K3作为混合专家模型,在处理每个Token时仅激活896个专家中的16个。这虽然节省了计算电力,但要求包裹在不同工位间频繁流转,即所谓的All-to-All通信。这种通信模式对带宽和延迟极其敏感。基准测试显示,跨节点的通信速度远低于域内速度。因此,月之暗面建议在部署时使用由64个或更多加速器组成的“超节点”,以确保推理效率。这意味着,64卡已成为经济运行的门槛,传送带的长度直接决定了工人的效率。
其次,缓存分离技术通过自研的Mooncake架构,将KV Cache从单卡显存中解放出来,在集群的处理器、内存和硬盘间流转。这使得编程场景下的缓存命中率超过90%,实际输入价格大幅降低。然而,这种高效搬运依赖于集群内部大规模的数据传输能力。基准数据显示,一台插满8张400G网卡的节点,搬运40GB缓存的速度可达190GB/s。换言之,四分之一的输入价优惠,是建立在极高的网络带宽基础之上的。
第三,数据压缩技术利用自研的KDA线性注意力机制,大幅减小了缓存体积。尽管包裹变小了,但仍需在网络中调度。月之暗面的系统论文明确指出,下一代模型的KV Cache可以跨数据中心调度,将缓存视为一等公民资源。这三项技术共同指向一个结论:省钱的每一招,都建在网络上。推理集群已演变为过去只有训练集群才具备的高带宽、低延迟形态。
随着模型参数的激增,最小服务单元也在不断扩大。从K2的16卡到K3的64卡,再到DeepSeek-V3解码阶段的320卡,这一代模型的生长形态决定了其对硬件集群的严苛要求。SemiAnalysis指出,K3需要更多的GPU、HBM、DRAM和网络支持。停售公告中的“承载极限”,实质上是长成这种特定形状的算力池供给不足。卡本身或许可以买到,但将几十张卡绑定成一个高效协同的域,并支撑稀疏、缓存和压缩所需的高速通信,绝非临时拼凑几台机器所能实现。
在这种背景下,产业链的价值分配正在发生转移。第一道闸门是高带宽内存(HBM)。由于模型权重巨大,单台机器显存无法容纳,必须分布在集群中。国产HBM产能虽有提升,但良率与国际大厂仍有差距,库存有限。这意味着未来一两年内,能建设的算力园区数量基本已定,HBM成为最确定且缺乏弹性的瓶颈环节。
其次,采购单位从“买卡”转向“买超节点”。在世界人工智能大会上,各家厂商纷纷展示其超节点方案。工程边界在于“铜的半径”。铜缆便宜稳定,但仅适用于机柜内部连接;一旦跨越机柜,就必须使用光模块。阿里的磐久方案在柜内全用铜缆,而华为CloudMatrix 384则采用柜内铜、柜间光的混合架构。随着最小服务单元从64卡向320卡演进,负载必然推向机柜外部,光互连的需求随之跳级增长。
最后,跨集群的高速以太网成为最具弹性的增长点。800G和1.6T光模块的需求预计将大幅增长。谷歌和OpenRouter的数据显示,Agent产生的流量已超过人类,且单条请求消耗的Token更多。尽管模型效率在提升,如K3输出Token减少21%,但总货量的增长速度远超单件瘦身的速度。这是一场总货量与单位效率的赛跑,目前看来,总货量占据上风,光互连的逻辑依然成立。
综上所述,Kimi停售事件并非孤立个案,而是大模型行业从价格战转向算力形态竞争的缩影。未来的竞争焦点将不再仅仅是模型参数的多少或单Token的价格,而是谁能构建更高效、更大规模的超节点集群,以及谁能掌握HBM和光互连等核心基础设施的资源。对于产业参与者而言,关注64卡以上国产集群的落地情况、Qwen3.8的部署指引以及光模块采购流向,将是判断行业走势的关键指标。算力不再是简单的加法,而是基于网络拓扑的系统工程,这一认知转变将深刻影响未来几年的AI产业格局。