一、最新产品和最新架构不是同一个版本号
GLM-5.3 于 2026-08-14 发布,但官方写明“Scaling post-training is all we did”。因此 5.3 没有披露新的 attention、MoE 或视觉 backbone;它沿用 5.2。
| 版本 | 主要变化 | 架构判断 |
|---|---|---|
| GLM-5.2 | 1M context、IndexShare、MTP 改进 | 最新公开基座架构 |
| GLM-5.3 | 扩大长任务与安全环境的 RL 后训练 | 同一 base model |
二、GLM-5.2 的 decoder-only MoE 主干
公开 checkpoint 类型为 GlmMoeDsaForCausalLM:78 层、hidden size 6144,前 3 层使用 dense FFN,后续层使用 sparse MoE;256 个 routed experts 中每 token 选 8 个,另有 1 个 shared expert。
系列官方标签为 744B 总参数、40B 激活;Hugging Face checkpoint 页面可能按存储张量统计出约 753B。两者统计边界未被完整解释,应保留而非强行合并。
三、MLA、DSA、IndexShare 如何叠加到 1M
MLA 用 512 维 KV latent 控制缓存;DSA 用 Lightning Indexer 为每个 query 选择 Top-2048 token,减少核心 MLA 计算;IndexShare 再让每四层共享一次 indexer 结果,减少索引器本身的全长 dot product 与 Top-k。
这三层优化解决不同瓶颈:缓存宽度、核心 attention 范围、索引器重复次数。即使如此,官方也指出 KV-cache 容量、长上下文 kernel 和 CPU 调度仍是 1M serving 的主要约束。
四、MTP 不改变主模型答案,而是帮助更快验证
Multi-Token Prediction draft 层一次提议多个后续 token,主模型再并行验证,接受共同前缀。GLM-5.2 让多步 MTP 共享参数,并复用第一步的 KV state 与 Top-k indices。
官方在 GLM-5.1 backbone/data 的受控 coding 场景中,以 7 个 MTP steps 报告 acceptance length 从 4.56 提升到 5.47。该 20% 是接受长度,不等于端到端延迟必然改善 20%。
五、GLM-5.3 真正新增的是训练系统
5.3 扩大可执行、可验证的长任务环境,并沿用 SAO、compaction 与 slime 异步 RL 基础设施。官方报告编码和安全任务显著提升,但这些是 post-training 能力结果,不应反推为新的 DSA 或 MoE 结构。
当厂商明确说 base model 不变时,合理结论是“同架构、不同后训练策略”,而不是根据 benchmark 变化猜测隐藏层或专家数发生改变。
六、发布状态与未公开内容
截至 2026-08-24,GLM-5.2 权重和配置已公开;GLM-5.3 已通过产品/API 发布,但官方计划在发布两周后开放权重。因此 5.3 的相同基座结论来自官方声明,精确 checkpoint 尚待权重发布验证。
5.3 的完整环境混合、RL 数据规模、奖励配方和安全后训练细节没有全部公开。
评论加载中...