Kimi K3发布47页技术报告:2.8T参数背后的系统级架构重构

3 阅读

超越参数规模:Kimi K3 的核心技术主线

2026年7月28日,Moonshot AI 发布了 Kimi K3 的开放权重技术报告。相较于 Kimi K2,Kimi K3 在规模上实现了显著跃升:总参数量达到 2.8T,激活参数量增至 104B,上下文窗口扩展至 100 万 token。这些宏观数据固然引人注目,但若仅止步于对参数规模的惊叹,则容易忽略这份 47 页技术报告真正蕴含的技术价值。

Kimi K3 试图解决的是一个更具工程挑战性的核心问题:当大模型继续扩大规模,且上下文窗口不断变长时,传统的 Transformer 架构及其训练系统是否还能有效支撑 Agent 连续执行数小时的复杂任务?在实际场景中,随着上下文长度增加,KV Cache 的存储成本呈线性甚至超线性膨胀;随着网络深度增加,早期层的信息在多次叠加后容易丢失;随着 Mixture of Experts (MoE) 专家数量激增,路由算法、通信带宽及设备负载极易失控;而 Agent 的执行轨迹拉长后,强化学习过程又常被少数耗时极长的慢任务所阻塞。

单纯依靠增加 GPU 数量无法从根本上解决上述系统性瓶颈。Kimi K3 的技术主线并非简单地将 K2 放大三倍,而是对大模型保存信息、调度计算资源以及持续完成长程任务的底层逻辑进行了重新设计。它通过一系列架构级创新,将原本随规模膨胀的计算和状态,转化为可压缩、可调度、可暂停与恢复的结构化形式。

序列、深度与宽度:三维架构的创新解法

Kimi K3 针对 Transformer 在序列、深度和宽度三个维度的扩展问题,分别提出了针对性的架构优化方案。这三项核心技术共同构成了其支撑庞大模型容量与长上下文处理能力的基础。

1. 序列维度:Kimi Delta Attention 与 Gated MLA 的协同

传统 Transformer 的自注意力机制需要保存历史 token 的 Key 和 Value,即 KV Cache。在长上下文场景下,KV Cache 的体积迅速增长,导致存储、搬运和读取成本急剧上升。这类似于在阅读大量文档时,若将每一页都摊在桌面上,虽然查找精确,但空间成本不可承受。

为此,Kimi K3 引入了 Kimi Delta Attention (KDA)。KDA 采用固定大小的递归状态来保存历史信息。模型不再完整保留每个 token 的原始信息,而是在阅读过程中不断更新一份压缩记忆。无论序列如何增长,这份状态的大小保持恒定。然而,压缩必然伴随细节损失。全注意力机制保存的是原始档案,支持任意位置的精准回溯;而 KDA 更像是一份持续更新的摘要,信息在反复写入时存在被覆盖的风险。

为平衡效率与信息容量,Kimi K3 并未全盘采用 KDA,而是设计了混合注意力机制:在每个模块中安排 3 层 KDA 和 1 层 Gated MLA(Grouped-query Multi-Head Latent Attention),并在模型末尾保留全局注意力。两者的分工明确:KDA 负责低成本地更新长期状态,实现信息压缩;Gated MLA 则定期重新检查完整上下文,负责精准查找。这种机制既缓解了长上下文下的显存压力,又保留了关键信息的可检索性。

此外,Kimi K3 对 KDA 的衰减参数进行了调整。此前某些衰减值过小,累计计算后易超出 BF16 格式的安全范围,迫使计算采用效率较低的特殊 kernel。Kimi K3 为衰减设置了下界,确保相关计算能统一转换为 Tensor Core 擅长的稠密矩阵乘法。这一改动虽未提出全新的注意力概念,却深刻体现了其工程落地思路:算法优化必须适配硬件特性,而不仅仅是追求理论复杂度上的更优。

值得注意的是,100 万 token 的上下文窗口并不意味着模型能无损记住所有内容。Kimi K3 采用了从 8K 到 1M 的渐进式训练策略,并构造了关键信息分散的长上下文数据。KDA 解决的是长上下文能否持续运行的问题,而非彻底消除长距离信息损失。

2. 深度维度:Attention Residuals 的信息复用

在深层网络中,信息同样面临压缩与丢失的问题。标准残差连接将每一层的输出累加到同一个隐藏状态中,随着网络加深,早期层的词法信息、中间层的结构特征容易在多次叠加中混杂丢失。后续层难以单独提取特定阶段形成的局部特征。

Kimi K3 提出的 Attention Residuals (AttnRes) 改变了这一机制。AttnRes 允许当前层对前面不同深度的表示进行加权选择,而非仅仅接收最终版本的累加结果。这类似于 Transformer 通过自注意力从不同历史位置读取信息,AttnRes 将这种选择机制从序列维度延伸到了网络深度维度。

为控制显存和通信成本,Kimi K3 并未保留全部 93 层的独立输出,而是将约 12 层聚合为一个 Block,再对不同 Block 的表示进行选择。这是一种工程折中:模型可以重新调用不同深度的信息,但定位粒度为 Block 而非单层的任意一层。AttnRes 使用的查询主要为每层学习得到的伪查询,虽非动态生成,但相比固定残差连接已具备更高灵活性。该设计不依赖超大参数规模,且具有普适性,可能成为深层网络优化的重要参考方向,但其独立贡献仍需更多外部验证。

3. 宽度维度:Stable LatentMoE 与量化均衡

在处理模型宽度扩展时,Kimi K3 每层拥有 896 个路由专家,每个 token 选择其中 16 个。更大的专家池虽增加模型容量,但也带来通信、显存读取、激活异常及负载不均衡等风险。

传统 MoE 需将完整隐藏状态发送给被选中的专家,激活专家越多,传输数据量越大。Kimi K3 采用 LatentMoE 机制:先将 7168 维的隐藏状态压缩至 3584 维,在较窄空间中由专家计算,再映射回完整维度。这使得模型能在增加专家总数和激活数量的同时,避免通信量按完整隐藏维度增长。

然而,连续的降维、计算和升维易放大异常激活。Kimi K3 在专家聚合后加入 RMSNorm,并使用 SiTU-GLU 替代 SwiGLU。SiTU-GLU 作为一种平滑限幅装置,在数值正常时保留 SwiGLU 特性,数值过大时限制增长,从而降低低精度训练中的溢出风险。

在设备负载方面,Kimi K3 提出 Quantile Balancing 算法。传统方法通过固定步长调整路由偏置,易在过载与空闲间震荡。Quantile Balancing 根据整批路由分数的分位数,直接估计每个专家所需的偏置以接近目标负载。它不依赖试错,而是基于当前分布重新计算“录取线”,实现更精准的路由控制。

此外,MoonEP 为热门专家创建动态副本,从硬件层面确保不同设备接收相同数量的 token。算法层面的路由与硬件层面的执行相结合,共同解决了极端稀疏 MoE 的现实瓶颈。

Agent 基础设施:从同步训练到长程执行闭环

架构决定了模型的信息容量与计算效率,但让 Agent 连续工作数小时的真正难点在于强化学习系统与基础设施的配合。真实 Agent 任务(如编程、研究)往往包含数百次工具调用,轨迹漫长。

1. Partial Rollout 与异步强化学习

传统同步强化学习需等待整批任务完成,慢任务会拖慢整体训练进度。Kimi K3 采用 Partial Rollout 机制:一旦部分轨迹完成,系统立即使用这些数据更新模型;未完成轨迹暂停,待后续恢复执行。此举打破了长任务对整批训练的阻塞。

然而,长任务跨越多轮模型更新,会导致数据陈旧(Off-policy)。Kimi K3 通过逐 token 正则限制策略变化幅度,使训练能容忍高度 off-policy 的数据。系统接受异步与延迟的存在,而非强行维持同步流程,从而适应了长程 Agent 训练的现实需求。

2. AgentENV:基于微虚拟机的状态快照

恢复 Agent 工作现场不仅需要聊天记录,还需文件系统、进程状态等外部环境信息。Kimi K3 的 AgentENV 基于 Firecracker microVM 构建,支持暂停、恢复、复制和快照功能。训练和评估期间共创建超过 5100 万个 sandbox。

关键在于,sandbox 可在等待模型推理时暂停,避免持续占用 CPU 和内存;在模型生成下一步动作后快速恢复。这使得数小时的 Agent 轨迹能反复暂停与继续,让长程任务真正进入强化学习循环。

3. 原生多模态:视觉反馈作为纠错机制

Kimi K3 采用从零训练的原生多模态视觉编码器 MoonViT-V2,而非基于 SigLIP 等预训练模型初始化。实验显示,从零训练更稳定,避免了联合训练中的高频梯度尖峰。其多模态数据包含代码与渲染结果的配对(如网页、SVG、3D 资产),使视觉成为 Agent 的反馈通道。

模型不再仅依赖文本猜测结果,而是能通过视觉观察生成的界面、图形或视频,发现偏差并修正。这形成了“保存状态-执行工具-观察结果-调整动作”的完整闭环。

效能评估与行业启示

Kimi K3 相比 Kimi K2 实现了约 2.5 倍的整体 Scaling Efficiency。需注意,这并非指训练成本降低 60% 或推理速度提升 2.5 倍,而是指在相同计算量下获得更低验证损失。这一效率提升源于 KDA、AttnRes、Stable LatentMoE、数据处理及超参数搜索的共同作用,而非单一模块的贡献。

Kimi K3 在编程、搜索、专业工作流和长程工具调用方面表现卓越,但其优势建立在较高的推理投入之上。模型执行更多步骤、使用更多输出 token,并花费更长时间检查修正。这种“持续工作直至交付完整结果”的模式,适用于软件工程与复杂研究,但在简单问答场景中可能显得冗长昂贵。

官方评测混合使用了多种 Agent Harness,部分结果源自内部数据集。这表明在 Agent 阶段,模型能力已难以与运行环境分离。一个模型是否强大,取决于其参数权重、工具使用、上下文管理及系统计算投入的综合表现。

结语:系统整合的价值

Kimi K3 的技术报告揭示了一个重要趋势:大模型的发展正从单纯追求参数规模转向系统级架构重构。通过 KDA、AttnRes 和 Stable LatentMoE 处理信息流,通过 Partial Rollout 和 AgentENV 实现长程执行,通过原生多模态建立反馈闭环,Kimi K3 将架构、训练与 Agent 基础设施连接为完整系统。

当模型开始连续工作数小时,决定其能力上限的不再是单次生成的质量,而是其保存进度、保留现场、观察结果、发现错误并持续修正的系统性能力。这一范式转变,为下一代 AI Agent 的技术演进提供了清晰的路线图。