Native multimodal sparse MoE · MiniMax

MiniMax M3 架构

MiniMax M3 的核心取舍是把百万 token 注意力做成按 GQA group 检索的块稀疏计算,同时用 128 选 4 的 MoE 扩大模型容量,并从训练第一步混入文本、图像和视频。

428B / 23B官方模型卡披露约 428B 总参数、23B 激活参数和 1M token 上下文。
口径主干MSA视觉部署边界资料

一、为什么这里比较 M3,而不是更新的 H3

MiniMax 在 M3 之后还发布了 H3 视频/音频生成系统和 Music 3.0,但它们不是与 Kimi、GLM 横向可比的通用 LLM。M3 才是最新公开的通用多模态 Agent 基座。

因此本文限定输入为文本、图像和视频理解,输出仍是自回归 token;不把视频生成 diffusion/flow 架构混入同一比较。

二、60 层、128 选 4 的多模态 MoE

M3 文本主干 hidden size 6144,共 60 层。前 3 层使用 dense FFN,后 57 层使用 sparse MoE;每层 128 个 routed experts 中激活 4 个,另有 1 个 shared expert。64 个 query heads 共享 4 个 KV heads,形成 GQA。

MiniMax M3 总体数据流文本和视觉输入进入多模态投影后,由 GQA/MSA 与 MoE 主干处理。Text / Vision交错输入Vision towerPatch + 3D RoPEGQA + MSA块稀疏注意力MoE128 选 4LM head思考或回答
概念图:视觉塔只处理视觉输入;文本 token 直接进入语言空间。M3 从预训练第一步进行混合模态训练。
60文本主干层数
128 → 4路由专家与激活数
64 / 4Query heads / KV heads

三、MSA 如何把 1M context 变成块检索

前 3 层保持普通注意力,后续层启用 MiniMax Sparse Attention。MSA 把 KV 按 128 token 分块,为每个 query、每个 GQA group 选择 Top-16 blocks,随后只在这些块上做精确 softmax attention。

块粒度比 DSA 的 token 粒度粗,但更容易形成连续 GPU 访问。模型仍强制保留 local block,兼顾邻近依赖。

深入阅读 MSA 的算例与论文边界

四、原生图像与视频输入

视觉塔公开配置为 32 层、hidden size 1280、16 heads、patch size 14,使用 3D RoPE 表达空间与时间位置。Patch merge 将视觉 token 压缩,再由 projector 映射到 6144 维语言空间。

“从第一步混合模态训练”意味着视觉与语言主干共同适应,而不是先训练完 LLM 再只调一个 adapter;但它仍包含专门视觉塔,并非像素直接进入文本 embedding。

五、MTP、思考模式与部署成本

配置列出 QK norm、partial RoPE、SwiGLU-OAI 和 7 个 MTP modules。MTP 用于 speculative decoding;产品接口同时支持 enabled、adaptive、disabled 三种思考模式,这是生成策略和后训练行为,不是三套 backbone。

427B 级权重即便只激活约 23B,仍需保存全部专家,并承担 expert parallel 通信。低激活参数不会自动变成单机可部署。

六、哪些结果不能张冠李戴

MSA 论文实验模型不是 M3。

论文的 109B/6B 模型用于对照 GQA 与 MSA;M3 是约 428B/23B 的产品 checkpoint。论文中的 H800 kernel 加速不能直接写成 M3 端到端吞吐。

MiniMax 尚未发布覆盖 M3 全训练系统的完整技术报告。预训练 token 数、数据比例、全部 MoE 稳定化策略与 RL 配方仍不完整。

评论加载中...