Kimi K3 发布核实与 Moonshot AI 主干架构演变

检索截止:2026-07-29 00:45(中国标准时间)
范围:只讨论主干网络结构,重点为 MoE、注意力与跨层信息流;不展开训练数据、对齐、部署、产品或商业分析。

核心结论

Moonshot AI 已正式发布 Kimi K3,不是误传或预告名称。 截至检索时点,Kimi 官方发布博客明确写明“Kimi K3 is available today”;开放平台提供可调用的 kimi-k3 模型 ID;MoonshotAI 官方 GitHub 仓库已经发布完整技术报告,并声明完整模型权重按 Kimi K3 License 开放。[1][2][3][4]

K3 也不是对 K2 的简单扩参。K2/K2.5 的语言主干是“全层 MLA + 常规稀疏 MoE”;K3 则同时改造三条信息通路:

真正的演变不是一条直线。K2→K2.5 有官方明确的继续预训练关系,语言主干配置也保持一致;Kimi Linear→K3 则是独立实验模型的架构设计被旗舰主干沿用,不代表权重继承;2025 年初的 Kimi k1.5 未披露足以比较的主干规格,因此不能把它确定为 K2 的结构前身。[4][5][6][7][9]

一页时间线

时间公开节点主干结构意义与下一代的关系
2025-01Kimi k1.5,arXiv:2501.12599官方重点披露长上下文推理与多模态能力,未给出足以比较的 MoE、层数或注意力主干规格不承担本文的主干结构节点;这不表示其内部架构与后续模型无关
2025-07Kimi K2,arXiv:2507.205341T/32B 激活、61 层、384 选 8 MoE、1 个共享专家、全层 MLA成为 K2.5 的明确基础主干,也是 K3 对比扩展效率的基线
2025-10Kimi Linear,arXiv:2510.26692独立 48B/3B 激活模型;首次系统采用 3:1 KDA/MLA 混合注意力K3 报告明确沿用其混合设计,但没有权重继承关系的公开说明
2026-01Kimi K2.5官方明确称在 Kimi-K2-Base 上继续预训练;语言主干配置保持,加入 MoonViT 原生视觉入口,上下文扩至 256K属于 K2 基础主干与配置的延续,但不是 K3 线性注意力的中间版本
2026-03Attention Residuals,arXiv:2603.15031将内容相关的选择机制从序列轴扩展到网络深度轴Block AttnRes 随后进入 K3
2026-07Kimi K32.8T/104B 激活、93 层;KDA/Gated MLA、Block AttnRes、Stable LatentMoE 汇合当前正式发布的 K3 首代旗舰主干

时间采用论文、官方仓库及发布材料可核查的公开时点;仓库创建时间只作为入口出现的下界,不冒充模型内部开发完成日。[3][5][6][7][8][9]

1. K2:一万亿参数级主干的公开基线

K2 是这条架构史中第一个规格足够完整的锚点:总参数约 1T,每个 token 激活 32B;共 61 层,其中首层为 dense,后续采用 MoE;有 384 个路由专家,每个 token 选 8 个,并始终经过 1 个共享专家。注意力隐藏维度为 7168、64 heads,所有注意力层采用 MLA,上下文为 128K,前馈激活为 SwiGLU。[5]

MLA 如何传递信息

Multi-head Latent Attention(MLA)不是线性注意力。它仍执行全局 token-to-token 注意力,但先把每个 token 的 key/value 内容压缩到低维 latent c_t;缓存时保存 c_t,计算注意力时再通过上投影恢复各头所需的内容键和值。这样降低 KV 缓存体积,同时保留任意位置之间的全局内容交互。K3 技术报告明确确认 K2 和 K2.5 均采用 MLA。[4]

K2 的 MoE 如何工作

router 根据 token 隐藏表示从 384 个路由专家中选出 8 个;共享专家承担普遍变换,路由专家提供按 token 分配的专门容量,结果再汇合回主干。公开材料没有显示 K2 具有 K3 的 latent-space routed path,因此不能把 K3 的 Stable LatentMoE 结构反推给 K2。[5]

2. K2.5:保留语言主干,加入原生视觉入口

K2.5 官方材料明确说明它建立在 Kimi-K2-Base 之上。其语言侧仍是 1T/32B 激活、61 层、384 选 8、1 个共享专家、7168 hidden 和 MLA;上下文由 K2 公布的 128K 增至 256K。新增的主要结构是 MoonViT 视觉编码器和 projector:图像/视频先被编码,再映射到语言主干的共享 embedding 空间。[6]

所以 K2→K2.5 的主干变化应表述为:保持 MoE/MLA 语言骨架,扩大上下文并接入原生视觉通路。它不是从全局注意力过渡到 KDA 的中间形态。

3. Kimi Linear:K3 注意力的架构先导

Kimi Linear 是独立的 48B 总参数、3B 激活实验模型,而不是 K2.5 的继续预训练版本。它把三层 KDA 与一层全局 MLA 周期性交错,在 1M 上下文下用固定大小的递归状态承担大部分序列混合,同时定期恢复一次高容量的全局交互。K3 报告多处明确写出 “following Kimi Linear” 并称 K3 沿用其 hybrid design,因此这里的“先导”指结构设计来源,不指 checkpoint 血缘。[4][7]

KDA 为什么不同于 MLA

KDA 维护每个 attention head 的状态矩阵 S_t。到达新 token 时,它先用逐通道 retention α_t 衰减旧状态,再用写强度 β_t、当前 key 和 value 修正状态;query 从更新后的状态读出结果。其关键性质是:

  1. 状态大小不随上下文长度增长,适合长序列;
  2. 逐通道遗忘比单一标量门更细,可让不同特征保留不同时间尺度;
  3. 训练时可采用“chunk 间递归、chunk 内并行”的形式,避免逐 token 串行训练。[4][7]

固定状态也意味着纯 KDA 可能难以保留所有精确远距细节。周期性 MLA 因此承担全局内容检索:KDA 提供高效、带近期偏置的连续混合,MLA 定期提供不受固定递归状态容量限制的全局读取。3:1 是两种责任的结构折中,不表示 KDA 与 MLA 在数学上等价。[4][7]

K3 对 Kimi Linear 的进一步修改

K3 沿用 3:1 混合骨架,但并非原样放大:

4. Attention Residuals:从“逐层累加”变成“按需读取深度”

标准 PreNorm Transformer 将所有历史层输出以固定单位权重不断累加到单一状态。网络越深,早期表示越容易被稀释,隐藏状态幅值也可能持续增长。AttnRes 把注意力思想应用到网络深度:每一层拥有一个可学习 pseudo-query,对 embedding 和较早层输出做 RMSNorm 后的 softmax 加权,当前层据输入内容选择需要的深度表示。[8]

完整形式需保留所有 L 个层输出,内存为 O(Ld)。Block AttnRes 改为块内常规累加、块间选择:只保留 N 个块级表示,内存与跨流水级通信降至 O(Nd)。K3 将 93 层划为 8 个、通常每块 12 层的组;计入 embedding 后形成 9 个候选深度来源。[4][8]

这解释了一个容易混淆之处:KDA/MLA 决定一个 token 沿序列读取哪些位置的信息;AttnRes 决定一个子层 沿深度读取哪些早期表示。三者都使用“attention”一词,但作用轴不同。

5. K3 的 Stable LatentMoE:专家更多,但路由路径更窄

K3 扩展到 2.8T 总参数、104B 激活参数。每个 MoE 层包含 896 个路由专家,每 token 激活 16 个,另有 2 个全宽共享专家;latent MoE 宽度为 3584,单专家 hidden 为 3072。[3][4]

从路由专家数量看,K2 每 token 激活 8/384≈2.08%,K3 激活 16/896≈1.79%:专家绝对激活数翻倍,但占专家池的比例略降,K3 报告也将其写作 sparsity 56(896/16)。与此同时,激活参数由 32B 升到 104B,所以“比例更稀疏”不等于每 token 计算量更低;真正的结构杠杆是让更多路由专家在较窄 latent 空间工作。[4][5]

传统 MoE 让每个被选专家处理完整 d 维 token 表示,激活专家越多,通信和专家权重流量越大。LatentMoE 将公共路径和专门路径分开:

  1. 两个共享专家直接处理完整 d 维表示,保留公共变换;
  2. routed path 先用 W_down 把 token 压到较窄的 维;
  3. router 在 latent 空间选择并聚合 16 个专家;
  4. 聚合结果经 RMSNorm,再用 W_up 返回 d 维,与共享路径相加。[4]

因此 K2→K3 的 MoE 变化不只是“384→896、8→16、1→2”。专家路由从 full-width 计算改为 latent-width 计算,使更大的专家池和更高的 active count 在通信上可承受。

极端稀疏度又引出稳定性问题。K3 报告指出,降维、专家 GLU、升维构成的连续矩阵链会放大内部激活;近千专家也让传统负载均衡 bias 更新变得敏感。Stable LatentMoE 的对应修正是:升维前加入 RMSNorm;用有界的 SiTU-GLU 抑制大正输入下的激活爆炸;用 Quantile Balancing 直接根据 router-score 分位数调节专家分配。[4]

6. K3 主干如何拼合

Kimi K3 官方架构图 Figure 2

图 1|Kimi K3 技术报告 Figure 2。 来源:Moonshot AI / Kimi Team,《Kimi K3: Open Frontier Intelligence》,Figure 2。[4] 图中右侧是主干:每个重复单元含 3 个 KDA 子层和 1 个 Gated MLA 子层,每个注意力子层后接 Stable LatentMoE;红色线路是 Block AttnRes 对 embedding 与历史块表示的选择性读取。左下展开 KDA 的 query/key/value、逐通道 retention α 与写门 β;左上展开 full-width shared experts 与 latent routed experts。底部 MoonViT-V2 经 projector 进入共享 embedding 空间。图像由官方 PDF 第 3 页直接裁取,未重绘。

K3 的 93 个注意力层实际为 69 KDA + 24 Gated MLA:23 组完整的“3+1”后,再以一层 Gated MLA 收尾,确保最终表示经过全局注意力。每个注意力层都配一个 Stable LatentMoE,AttnRes 则位于这些子模块之前,决定本次计算从哪些深度表示开始。[3][4]

结构轴K2 / K2.5Kimi LinearK3主要收益主要代价或限制
序列混合全层 MLA,保留全局 token 交互3 KDA : 1 MLA69 KDA + 24 Gated MLA,末层全局长上下文下把大部分混合转为固定状态,同时保留周期性全局读取KDA 状态容量有限,门控和数值实现更复杂
位置处理MLA 配合显式位置扩展方案混合结构MLA 使用 NoPE,位置/近期信息主要由 KDA 承担扩上下文时无需重调 MLA 的 RoPE/YaRN 参数位置责任分散到不同子层,分析和实现更难
深度信息流标准残差累加标准残差8-block AttnRes早期表示可按内容重取,减轻深度稀释需保存块级状态与计算跨深度权重
专家路由384 选 8 + 1 shared,完整宽度48B/3B 的独立 MoE896 选 16 + 2 shared,routed path 在 latent 空间以可控通信扩展专家专门化空间极端稀疏度要求额外归一化、激活约束和负载均衡
主干规模1T/32B,61 层48B/3B 实验模型2.8T/104B,93 层同时扩大总容量与每 token 激活容量公开材料不足以把能力增益拆成单模块因果贡献

7. 哪些结论仍需克制

  1. 官方约 2.5× overall scaling efficiency 不是纯架构消融,也不是部署吞吐比。 K3 报告称该结果来自架构、训练、数据配方与关键超参数的共同改进,并在留出的 OOD validation data 上拟合 scaling-law 曲线;报告没有给出能把 2.5× 分解到 KDA、AttnRes 或 Stable LatentMoE 单项的受控结果。[4]
  2. “正式发布”不等于本文逐字节验证了全部权重分片。 官方仓库、许可证和技术报告均声明完整权重已发布,并给出 Hugging Face 模型入口;本次因该端点连接超时,没有逐个枚举或校验远端分片。[3][4]
  3. K1.5 不是已证实的 K2 架构前身。 它的公开报告主要支持推理训练史结论,无法支持层数、MoE 或 attention backbone 的连续继承。[9]
  4. Kimi Linear 是架构先导,不是 K2.5 的权重世代。 K3 报告明确沿用其混合注意力设计,但公开材料没有说 K3 从该 48B checkpoint 继续训练。[4][7]
  5. 本次核实对象是当前公开的 Kimi K3 模型。 现有官方仓库主要对应这一权重;不能仅凭 K3 名称推断已有多个子型号,更不能推断未来版本会保持相同结构。

参考资料

[1] Kimi,Kimi K3 官方发布博客,2026,https://www.kimi.com/blog/kimi-k3

[2] Kimi 开放平台,Kimi K3 快速入门与模型介绍,2026,https://platform.kimi.com/docs/guide/kimi-k3-quickstart

[3] Moonshot AI,MoonshotAI/Kimi-K3 官方仓库与模型卡,2026,https://github.com/MoonshotAI/Kimi-K3

[4] Kimi Team,Kimi K3: Open Frontier Intelligence — Technical Report,2026,https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf

[5] Moonshot AI,MoonshotAI/Kimi-K2 官方仓库与模型卡,2025,https://github.com/MoonshotAI/Kimi-K2

[6] Moonshot AI,MoonshotAI/Kimi-K2.5 官方仓库与模型卡,2026,https://github.com/MoonshotAI/Kimi-K2.5

[7] Kimi Team,Kimi Linear: An Expressive, Efficient Attention Architecture,arXiv:2510.26692,2025,https://arxiv.org/abs/2510.26692

[8] Kimi Team,Attention Residuals,arXiv:2603.15031,2026,https://arxiv.org/abs/2603.15031

[9] Kimi Team,Kimi k1.5: Scaling Reinforcement Learning with LLMs,arXiv:2501.12599,2025,https://arxiv.org/abs/2501.12599

[10] Kimi Team,Kimi K2: Open Agentic Intelligence,arXiv:2507.20534,2025,https://arxiv.org/abs/2507.20534

[11] Moonshot AI,FlashKDA: Flash Kimi Delta Attention,2026,https://github.com/MoonshotAI/FlashKDA

[12] DeepSeek-AI,DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model,arXiv:2405.04434,2024,https://arxiv.org/abs/2405.04434