Native multimodal MoE · Moonshot AI

Kimi K3 架构

Kimi K3 不是只把 K2 放大:它分别改造 token、深度和通道三条信息混合轴。理解 K3 的关键,是看 KDA、AttnRes 与 Stable LatentMoE 如何共同服务 2.8T 参数和 1M 上下文。

2.8T / 104B2.8T 总参数、约 104B 激活;93 层,1M token,原生视觉输入。
主问题总架构注意力MoE视觉证据资料

一、K3 在同时解决哪三个扩展问题

把上下文、深度和专家数一起扩大,会分别遇到注意力二次成本、残差稀释和 MoE 训练/通信压力。K3 的架构叙事正好沿这三条轴展开。

混合轴问题K3 组件
Token / 序列1M 全注意力昂贵KDA + 周期性 Gated MLA
Layer / 深度固定残差累加稀释新层Block Attention Residuals
Channel / 宽度896 专家直接作用宽残差过重Stable LatentMoE

二、一条输入如何穿过 Kimi K3

视觉输入先由 MoonViT-V2 编码和压缩;文本/视觉 token 进入 93 层主干。每层包含注意力子层和 FFN/MoE,Block AttnRes 决定深度表示如何聚合,Stable LatentMoE 决定通道专家如何工作。

Kimi K3 总体数据流视觉和文本 token 进入混合 KDA/MLA 主干,经 AttnRes 和 Stable LatentMoE 生成输出。Text / Vision统一 token 序列KDA ×3线性 token mixingGated MLA全局校正AttnRes + MoE深度与通道混合LM head自回归输出
概念图:K3 实际层计划为 69 KDA + 24 Gated MLA;AttnRes 与 MoE 分布在层内,图中按教学顺序展开。

三、69 层 KDA 与 24 层 Gated MLA

KDA 是 delta-rule 线性注意力,用固定大小状态递归读写历史;Gated MLA 保留精确全局 softmax,并用输出门控制写回。公开层计划近似每三层 KDA 插入一层 MLA,末尾再保留全局层。

这与 DSA/MSA 的路线不同:K3 多数层不先检索 Top-k,而是用递归状态压缩历史;只有周期性 MLA 层读取全局 latent KV cache。

深入阅读 Gated MLA;KDA 的完整更新公式见官方技术报告。

四、AttnRes 与 Stable LatentMoE

Block AttnRes 每 12 层管理一次深度状态,让当前层对历史块表示做内容相关 softmax 聚合。Stable LatentMoE 则把 routed-expert 路径从 7168 维压到 3584 维:896 个专家中每 token 选 16 个,另有 2 个共享专家。

93Transformer layers
896 → 16路由专家与每 token 选择数
7168 → 3584残差宽度到 latent MoE 宽度

深入阅读 AttnRes深入阅读 Stable LatentMoE

五、MoonViT-V2 与量化共同设计

401M 参数 MoonViT-V2 将图像/视频帧变成主干 token。公开配置为 27 层、1024 hidden、12 heads、patch size 14,并通过 PatchMergerV2 与 projector 接入 7168 维主干。

K3 从 SFT 起进行量化感知训练,公开权重以 MXFP4 weights / MXFP8 activations 为主要格式。量化是部署架构的一部分,但并不表示所有 attention、视觉塔和共享层都使用完全相同精度;配置明确排除若干模块。

深入阅读 MoonViT-V2

六、哪些是事实,哪些仍是厂商报告

公开权重让结构可检查,不等于所有效果已独立复现。

层数、维度、路由、量化格式与视觉配置可以从 checkpoint/config 验证。官方所称“较 K2 提升约 2.5 倍 scaling efficiency”依赖其训练实验和成本定义,应保留“团队报告”措辞。

完整数据构成、总训练 FLOPs、所有稳定化超参数与生产流量下的端到端成本仍未全部公开。

评论加载中...