Width mixing · Kimi K3

Stable LatentMoE

Stable LatentMoE 关注的不是“选择哪个专家”本身,而是专家在哪个表示空间里工作。Kimi K3 将路由专家从 7168 维残差流下沉到 3584 维 latent space,再映射回来。

896 选 16Kimi K3 每个 token 选择 16 个路由专家,并始终运行 2 个共享专家。
问题数据流参数预算稳定性边界资料

一、为什么专家不一定要直接吃完整残差宽度

标准 sparse MoE 通常让每个专家接收完整 (d_{model}) 隐藏状态。专家数增加时,参数容量快速增长;但专家投影、路由通信和输出尺度也更难控制。

Kimi K3 的目标是在宽残差流中保留共享表示能力,同时让数量巨大的路由专家在更窄的空间工作。这里的“latent”是模型内部通道压缩,不是扩散模型 latent,也不是 MLA 的 KV latent cache。

二、Stable LatentMoE 的路由路径

对 routed-expert 路径,隐藏状态先从 7168 维下投影到 3584 维;router 在该路径上选择专家,16 个专家输出聚合后经过 RMSNorm,再上投影回 7168 维残差空间。共享专家是始终可用的公共能力路径。

Stable LatentMoE 数据流完整残差表示先压缩到 latent space,分发给路由专家,聚合归一化后返回残差宽度。Residual7168 维Down projection3584 维 latentRouter896 选 16Experts + Norm稀疏聚合Up projection回到 7168 维
概念图:只展开 routed expert 路径。Kimi K3 还包含两个 always-on shared experts 和残差连接。
z = W_down x
u = RMSNorm(Σᵢ∈TopK gᵢ Eᵢ(z))
y = W_up u + shared(x)

三、它节省了什么,又新增了什么

若每个专家直接在 7168 维空间工作,896 个专家的参数量和单 token 专家计算都会更高。把 routed path 放进 3584 维 latent,可让专家数量增加而不按完整残差宽度付费。

组件Kimi K3 配置作用
残差宽度7168承载共享主干表示
Latent MoE 宽度3584隔离路由专家工作空间
单专家隐藏宽度3072SiTU-GLU 专家 FFN
路由896 中选 16扩大容量而保持稀疏激活

代价是新增 down/up projections,并要求这些公共投影成为所有 routed experts 的共享接口。

四、“Stable”主要来自哪些约束

  • 统一 latent 接口:专家不直接扰动完整残差宽度。
  • 聚合后 RMSNorm:控制多个专家输出合并后的尺度。
  • 共享专家:保留每个 token 都能访问的公共计算路径。
  • Quantile Balancing:K3 报告还描述了用于极大专家数训练的负载控制策略。

这些机制共同服务训练稳定性。不能把“Stable”理解为某一个归一化层单独保证零崩溃。

五、何时不值得采用

更深的模块不一定更便宜。

小模型、低并发推理或缺乏高效 expert-parallel kernel 时,down/up 投影、token dispatch 和 896 专家的存储成本可能超过容量收益。Stable LatentMoE 是为超大稀疏模型设计的系统方案,不是通用 FFN 的默认替代。

公开资料足以描述 inference graph,但完整训练数据、全部路由稳定化超参数和不同规模下的独立复现仍有限。

评论加载中...