一、K3 在同时解决哪三个扩展问题
把上下文、深度和专家数一起扩大,会分别遇到注意力二次成本、残差稀释和 MoE 训练/通信压力。K3 的架构叙事正好沿这三条轴展开。
| 混合轴 | 问题 | K3 组件 |
|---|---|---|
| Token / 序列 | 1M 全注意力昂贵 | KDA + 周期性 Gated MLA |
| Layer / 深度 | 固定残差累加稀释新层 | Block Attention Residuals |
| Channel / 宽度 | 896 专家直接作用宽残差过重 | Stable LatentMoE |
二、一条输入如何穿过 Kimi K3
视觉输入先由 MoonViT-V2 编码和压缩;文本/视觉 token 进入 93 层主干。每层包含注意力子层和 FFN/MoE,Block AttnRes 决定深度表示如何聚合,Stable LatentMoE 决定通道专家如何工作。
三、69 层 KDA 与 24 层 Gated MLA
KDA 是 delta-rule 线性注意力,用固定大小状态递归读写历史;Gated MLA 保留精确全局 softmax,并用输出门控制写回。公开层计划近似每三层 KDA 插入一层 MLA,末尾再保留全局层。
这与 DSA/MSA 的路线不同:K3 多数层不先检索 Top-k,而是用递归状态压缩历史;只有周期性 MLA 层读取全局 latent KV cache。
深入阅读 Gated MLA;KDA 的完整更新公式见官方技术报告。
四、AttnRes 与 Stable LatentMoE
Block AttnRes 每 12 层管理一次深度状态,让当前层对历史块表示做内容相关 softmax 聚合。Stable LatentMoE 则把 routed-expert 路径从 7168 维压到 3584 维:896 个专家中每 token 选 16 个,另有 2 个共享专家。
五、MoonViT-V2 与量化共同设计
401M 参数 MoonViT-V2 将图像/视频帧变成主干 token。公开配置为 27 层、1024 hidden、12 heads、patch size 14,并通过 PatchMergerV2 与 projector 接入 7168 维主干。
K3 从 SFT 起进行量化感知训练,公开权重以 MXFP4 weights / MXFP8 activations 为主要格式。量化是部署架构的一部分,但并不表示所有 attention、视觉塔和共享层都使用完全相同精度;配置明确排除若干模块。
六、哪些是事实,哪些仍是厂商报告
层数、维度、路由、量化格式与视觉配置可以从 checkpoint/config 验证。官方所称“较 K2 提升约 2.5 倍 scaling efficiency”依赖其训练实验和成本定义,应保留“团队报告”措辞。
完整数据构成、总训练 FLOPs、所有稳定化超参数与生产流量下的端到端成本仍未全部公开。
评论加载中...