Kimi算力熔断背后:杨植麟的“摸高”战略与AI效率革命

1 阅读

算力过载下的反向操作:Kimi的“熔断”逻辑

2026年7月,人工智能领域发生了一起看似反常却极具象征意义的事件。月之暗面团队发布公告,宣布暂停Kimi新用户订阅,将有限算力优先保障现有用户。这一决定直接源于K3模型上线48小时内,用户请求量大幅超出预估,导致算力资源紧张。在各大模型厂商拼命通过免费或降价手段吸纳新用户的当下,Kimi的“婉拒新客”显得格格不入,甚至被外界解读为一种“凡尔赛”式的炫耀。

然而,剥开表象,这实际上是模型能力跃升带来的必然副作用。K3作为月之暗面首款3万亿参数级MoE(混合专家)模型,其总参数规模达到2.8万亿。按照常规理解,如此规模的模型在每次输出时,算力消耗呈指数级增长。C端用户规模的激增,虽然带来了巨大的流量声量,但对收入的直接贡献并不明显,反而让GPU集群不堪重负。这种“C端用户越多,收入贡献越不明显,但硬件扛不住”的烦恼,正是当前AI行业普遍面临的结构性矛盾。

Kimi的选择并非简单的资源分配问题,而是对“模型生产效率”的一次重构。在算力受限或成本约束的背景下,月之暗面没有选择继续堆叠硬件,而是通过系统级架构创新,试图在有限算力条件下实现性能与效率的平衡。这一决策背后,隐藏着中国AI企业在技术路线与商业逻辑上的深层思考。

算法层面的“韬定律”:KDA与效率革命

长期以来,芯片行业依赖摩尔定律,依靠缩小晶体管尺寸来提升性能。但当先进制程逼近物理极限、成本暴涨时,单纯堆叠硬件的增长模式已走入瓶颈。华为今年提出的“韬定律”,跳出“空间缩微”的传统思路,转向“时间缩微”:通过逻辑折叠、三维堆叠、全链路架构优化,压缩信号传输时延、减少数据冗余搬运,在成熟制程上实现媲美先进制程的能效跃升。

K3所采用的核心技术架构,正是AI领域的“韬定律”实践。其核心在于三项关键技术:KDA(Kimi Delta Attention)混合线性注意力、注意力残差(Attention Residuals)和高稀疏度MoE。这三项技术共同构成了一架超级引擎,将每一分算力转化为模型效果的效率推到极致。

Transformer架构在注意力机制上最吃算力。标准注意力随序列长度呈平方级增长,在百万级上下文任务中,大部分算力消耗在维持长序列的注意力矩阵上。KDA机制将大部分注意力层的计算复杂度从平方级降至线性。根据月之暗面此前发布的技术报告,在实验模型上采用KDA与MLA混合比例,KV缓存占用最高削减75%,100万上下文长度下的解码吞吐量提升至原来的6倍。配合注意力残差与高稀疏度MoE技术,训练效率提升约25%,额外成本不到2%。

如果说硅谷主流的Transformer路线是“大力出奇迹”的燃油车,KDA更像是追求“热效率极致”的混动引擎。SemiAnalysis的报告指出,KDA将推理速度提升300%,同时在长上下文处理上保持接近Transformer的性能。这意味着同等算力投入下,K3能产出更多有效智能。开发者社区的实测反馈也证实,在长流程Agent任务和代码生成方面,K3表现突出,具备与国际头部模型竞争的实力。

从根本上说,K3依然遵循Scaling Law(缩放定律),但把刀挥向了粗糙的算法浪费。当硅谷AI企业还在不断囤卡、堆算力时,Kimi通过重构算法链路、精简计算冗余,走出一条“每瓦特智能产出比”最大化的路径。这种对“模型生产效率”的重构,不仅降低了单次使用成本,也刺激了需求总量的暴涨,最终导致了算力的“熔断”。

杨植麟的“摸高”:从流量思维到价值思维

Kimi算力被击穿,是技术成功的副作用,也是创始人杨植麟在三个维度上“摸高”的体现。回顾7月11日,智谱创始人唐杰宣布“Touch High摸高计划”,直言“不登顶,就是失败”,并明确表示未来两年不追求短期应用变现,而是集中资源攻坚AGI的四大核心方向。杨植麟的决策中,同样蕴含着这种冲击技术天花板、夯实长期竞争力的战略意图。

首先是算力维度的摸高:从流量思维切换到价值思维。 公开信息显示,Kimi的API业务占比已经突破了70%,与此前靠C端订阅模式大为不同。保老用户、拒新客,实则是将有限算力向高价值场景倾斜,避免泛C端流量挤占已是收入支柱的B端业务配额。这一策略的代价是执行标准的不透明,哪些请求被优先响应、哪些被降级处理,一旦处理失策,都会稀释用户信任。长远来看,Kimi要完成从技术明星向成熟AI头部企业的转变,就必须夯实弹性算力池、分级响应机制、动态调度能力等基础设施。

其次是定价维度的摸高:从廉价自助餐到价值分层。 公告中提及的“拆分Kimi主权益与Code权益”,既是应对算力短缺的短期调配,也可能预示着其定价体系重构的开端。过去,无论用户写代码、查资料还是闲聊,都支付相同费用、消耗相同算力。当高算力消耗的Code用户占比上升,这种模式必然导致结构性错配。Kimi借此机会进行会员权益拆分,也是在按使用场景重新定价:轻度用户享受基础服务,重度用户为高价值能力支付溢价。这是通过价值用户分层,在尝试争夺模型产品的定价权。目前,K3收费标准已达每百万Token 2.3美元,虽低于海外顶尖模型,但已创下国产模型新高。或许,Kimi也想告别廉价模式,对外传递一个认知:高性能模型具备定价能力。

最后是地位维度的摸高:从地缘变量到定价锚点。 K3发布后迅速引发全球关注。在独立AI模型评测机构Artificial Analysis发布的最新“智能指数(Intelligence Index)”中,其综合得分达到57分,位列全球第三,仅次于Claude Fable 5(60分)和GPT-5.6 Sol(59分),领先Claude Opus 4.8(56分)。这个成绩,也顺手打破了“开源落后闭源半代”的行业共识。同时,K3的影响力已溢出技术圈。美国科技投资机构将其视为AI发展的“拐点”,认为高质量开源模型正加速能力扩散;加州大学伯克利分校计算机科学教授声称,K3将中国开源模型与美国先进模型的差距,拉小至2到3个月。

资本市场的“确权”与隐忧

资本市场的反应同样剧烈。K3发布的首个交易日,英伟达单日市值蒸发约1111亿美元;摩根大通策略师在报告中直接称之为“DeepSeek 2.0”。这个加速度,才是改变定价逻辑的东西。此外,月之暗面ARR(年化收入)到6月已经接近3亿美元,海外增速400%,涨价60%后收入反增,这三组数据叠加,表明Kimi的“开源+效率”模式可以规模化变现。加上有消息披露,月之暗面正在寻求最快六个月在香港上市,估值在半年内从43亿美元飙升至315亿美元,涨幅超7倍。这些都是资本市场在给一条非硅谷主流路线的“确权”。它们为“能跑通单位经济模型的SOTA”下注时,也说明Kimi拥有了独立的估值逻辑,不再需要对标OpenAI或Anthropic来证明自己值多少钱。

然而,K3距离AGI还有很长的路。比如跑分,虽然K3只比Fable 5低了3分,但背后仍是不小的差距。另外,Kimi在技术报告里还承认了两个部署层面的缺陷:一是K3在训练中保留了完整的思考历史(thinking history),如果调用方没有正确地把之前的推理过程传回来,或者在会话中从别的模型切换到K3,输出质量就会明显下降;二是K3在任务模糊时会“过度主动”,更倾向于替用户做决定。这种“自作主张”在需要精确执行的工程流程里,容易触发连锁错误。还有一个容易忽视但极其重要的问题:幻觉。Artificial Analysis在测评中特别指出,K3的幻觉率比上一代 K2.6反而有所上升。

某种程度上,K3的光鲜与隐忧,是全行业算力供需失衡的缩影,也是中国AI产业在算力卡脖子、商业化未闭环、用户预期过高等重压下的集体阵痛。这些AI厂商的每一次过载、每一次“熔断”,都是中国AI“摸高”需要迈过去的坎儿。可以确定的是,一个新的竞争周期已经开启,大模型将从拼能力跨越到拼算力。谁能在算法、算力储备等基建上建立优势,谁才能笑到最后,并将定义下一代AI公司的生存标准。