一、为什么专家不一定要直接吃完整残差宽度
标准 sparse MoE 通常让每个专家接收完整 (d_{model}) 隐藏状态。专家数增加时,参数容量快速增长;但专家投影、路由通信和输出尺度也更难控制。
Kimi K3 的目标是在宽残差流中保留共享表示能力,同时让数量巨大的路由专家在更窄的空间工作。这里的“latent”是模型内部通道压缩,不是扩散模型 latent,也不是 MLA 的 KV latent cache。
二、Stable LatentMoE 的路由路径
对 routed-expert 路径,隐藏状态先从 7168 维下投影到 3584 维;router 在该路径上选择专家,16 个专家输出聚合后经过 RMSNorm,再上投影回 7168 维残差空间。共享专家是始终可用的公共能力路径。
u = RMSNorm(Σᵢ∈TopK gᵢ Eᵢ(z))
y = W_up u + shared(x)
三、它节省了什么,又新增了什么
若每个专家直接在 7168 维空间工作,896 个专家的参数量和单 token 专家计算都会更高。把 routed path 放进 3584 维 latent,可让专家数量增加而不按完整残差宽度付费。
| 组件 | Kimi K3 配置 | 作用 |
|---|---|---|
| 残差宽度 | 7168 | 承载共享主干表示 |
| Latent MoE 宽度 | 3584 | 隔离路由专家工作空间 |
| 单专家隐藏宽度 | 3072 | SiTU-GLU 专家 FFN |
| 路由 | 896 中选 16 | 扩大容量而保持稀疏激活 |
代价是新增 down/up projections,并要求这些公共投影成为所有 routed experts 的共享接口。
四、“Stable”主要来自哪些约束
- 统一 latent 接口:专家不直接扰动完整残差宽度。
- 聚合后 RMSNorm:控制多个专家输出合并后的尺度。
- 共享专家:保留每个 token 都能访问的公共计算路径。
- Quantile Balancing:K3 报告还描述了用于极大专家数训练的负载控制策略。
这些机制共同服务训练稳定性。不能把“Stable”理解为某一个归一化层单独保证零崩溃。
五、何时不值得采用
小模型、低并发推理或缺乏高效 expert-parallel kernel 时,down/up 投影、token dispatch 和 896 专家的存储成本可能超过容量收益。Stable LatentMoE 是为超大稀疏模型设计的系统方案,不是通用 FFN 的默认替代。
公开资料足以描述 inference graph,但完整训练数据、全部路由稳定化超参数和不同规模下的独立复现仍有限。
评论加载中...