一、为什么这里比较 M3,而不是更新的 H3
MiniMax 在 M3 之后还发布了 H3 视频/音频生成系统和 Music 3.0,但它们不是与 Kimi、GLM 横向可比的通用 LLM。M3 才是最新公开的通用多模态 Agent 基座。
因此本文限定输入为文本、图像和视频理解,输出仍是自回归 token;不把视频生成 diffusion/flow 架构混入同一比较。
二、60 层、128 选 4 的多模态 MoE
M3 文本主干 hidden size 6144,共 60 层。前 3 层使用 dense FFN,后 57 层使用 sparse MoE;每层 128 个 routed experts 中激活 4 个,另有 1 个 shared expert。64 个 query heads 共享 4 个 KV heads,形成 GQA。
三、MSA 如何把 1M context 变成块检索
前 3 层保持普通注意力,后续层启用 MiniMax Sparse Attention。MSA 把 KV 按 128 token 分块,为每个 query、每个 GQA group 选择 Top-16 blocks,随后只在这些块上做精确 softmax attention。
块粒度比 DSA 的 token 粒度粗,但更容易形成连续 GPU 访问。模型仍强制保留 local block,兼顾邻近依赖。
四、原生图像与视频输入
视觉塔公开配置为 32 层、hidden size 1280、16 heads、patch size 14,使用 3D RoPE 表达空间与时间位置。Patch merge 将视觉 token 压缩,再由 projector 映射到 6144 维语言空间。
“从第一步混合模态训练”意味着视觉与语言主干共同适应,而不是先训练完 LLM 再只调一个 adapter;但它仍包含专门视觉塔,并非像素直接进入文本 embedding。
五、MTP、思考模式与部署成本
配置列出 QK norm、partial RoPE、SwiGLU-OAI 和 7 个 MTP modules。MTP 用于 speculative decoding;产品接口同时支持 enabled、adaptive、disabled 三种思考模式,这是生成策略和后训练行为,不是三套 backbone。
427B 级权重即便只激活约 23B,仍需保存全部专家,并承担 expert parallel 通信。低激活参数不会自动变成单机可部署。
六、哪些结果不能张冠李戴
论文的 109B/6B 模型用于对照 GQA 与 MSA;M3 是约 428B/23B 的产品 checkpoint。论文中的 H800 kernel 加速不能直接写成 M3 端到端吞吐。
MiniMax 尚未发布覆盖 M3 全训练系统的完整技术报告。预训练 token 数、数据比例、全部 MoE 稳定化策略与 RL 配方仍不完整。
评论加载中...