Long-horizon MoE · Z.ai

GLM-5.3 / GLM-5.2 架构

GLM-5.3 的能力更新来自后训练扩展,而不是新 backbone。要理解最新 GLM,应把“5.3 的训练版本”与“5.2 首次公开的基础架构”分开。

同一基座Z.ai 明确说明 GLM-5.3 使用与 GLM-5.2 相同的 base model,提升来自更多环境、任务和后训练算力。
版本基座长上下文MTP后训练边界资料

一、最新产品和最新架构不是同一个版本号

GLM-5.3 于 2026-08-14 发布,但官方写明“Scaling post-training is all we did”。因此 5.3 没有披露新的 attention、MoE 或视觉 backbone;它沿用 5.2。

版本主要变化架构判断
GLM-5.21M context、IndexShare、MTP 改进最新公开基座架构
GLM-5.3扩大长任务与安全环境的 RL 后训练同一 base model

二、GLM-5.2 的 decoder-only MoE 主干

公开 checkpoint 类型为 GlmMoeDsaForCausalLM:78 层、hidden size 6144,前 3 层使用 dense FFN,后续层使用 sparse MoE;256 个 routed experts 中每 token 选 8 个,另有 1 个 shared expert。

系列官方标签为 744B 总参数、40B 激活;Hugging Face checkpoint 页面可能按存储张量统计出约 753B。两者统计边界未被完整解释,应保留而非强行合并。

GLM-5.2 / 5.3 基座数据流Token 经过 MLA/DSA、IndexShare 与 MoE 层,并使用 MTP 提议后续 token。Token6144 维MLA + DSA稀疏全局访问IndexShare四层复用MoE256 选 8LM + MTP验证式解码
概念图:5.3 延用这一 base model;5.3 的主要变化发生在后训练数据、环境与强化学习规模。

三、MLA、DSA、IndexShare 如何叠加到 1M

MLA 用 512 维 KV latent 控制缓存;DSA 用 Lightning Indexer 为每个 query 选择 Top-2048 token,减少核心 MLA 计算;IndexShare 再让每四层共享一次 indexer 结果,减少索引器本身的全长 dot product 与 Top-k。

这三层优化解决不同瓶颈:缓存宽度、核心 attention 范围、索引器重复次数。即使如此,官方也指出 KV-cache 容量、长上下文 kernel 和 CPU 调度仍是 1M serving 的主要约束。

深入阅读 DSA深入阅读 IndexShare

四、MTP 不改变主模型答案,而是帮助更快验证

Multi-Token Prediction draft 层一次提议多个后续 token,主模型再并行验证,接受共同前缀。GLM-5.2 让多步 MTP 共享参数,并复用第一步的 KV state 与 Top-k indices。

官方在 GLM-5.1 backbone/data 的受控 coding 场景中,以 7 个 MTP steps 报告 acceptance length 从 4.56 提升到 5.47。该 20% 是接受长度,不等于端到端延迟必然改善 20%。

五、GLM-5.3 真正新增的是训练系统

5.3 扩大可执行、可验证的长任务环境,并沿用 SAO、compaction 与 slime 异步 RL 基础设施。官方报告编码和安全任务显著提升,但这些是 post-training 能力结果,不应反推为新的 DSA 或 MoE 结构。

架构分析的证据边界。

当厂商明确说 base model 不变时,合理结论是“同架构、不同后训练策略”,而不是根据 benchmark 变化猜测隐藏层或专家数发生改变。

六、发布状态与未公开内容

截至 2026-08-24,GLM-5.2 权重和配置已公开;GLM-5.3 已通过产品/API 发布,但官方计划在发布两周后开放权重。因此 5.3 的相同基座结论来自官方声明,精确 checkpoint 尚待权重发布验证。

5.3 的完整环境混合、RL 数据规模、奖励配方和安全后训练细节没有全部公开。

评论加载中...