Native vision encoder · Kimi K3

MoonViT-V2

MoonViT-V2 是 Kimi K3 的视觉入口。它先把图像或视频帧变成 patch 表示,再压缩并投影到语言主干的 7168 维 token 空间,让视觉信息参与同一套自回归 next-token prediction。

401MKimi K3 模型卡披露 MoonViT-V2 约 401M 参数;公开配置为 27 层、1024 hidden、12 heads。
定位流程Token 压缩原生训练边界资料

一、视觉编码器解决的是“怎样进入语言主干”

语言模型不能直接读取像素。视觉编码器把二维图像或视频帧转换成一串具有语义的向量,再通过 projector 对齐到语言模型隐藏维度。

MoonViT-V2 延续 Vision Transformer 的 patch 化思路。它不是一个独立生成图像的 diffusion decoder,也不是完整 Kimi K3;它负责感知和接口转换,后续推理、工具使用和文本生成由 K3 主干完成。

二、从像素到 Kimi token 的数据流

公开配置显示 patch size 为 14,视觉塔 27 层、hidden size 1024、12 个注意力头;PatchMergerV2 将视觉 token 合并,再由多模态 projector 映射到 7168 维文本空间。

MoonViT-V2 视觉输入流程图像或视频帧被切成 patch,经过视觉 Transformer、token 合并和投影后进入 Kimi K3。Pixels / frames视觉输入Patch 14×14局部 tokenMoonViT-V227 层编码PatchMergerV2压缩 tokenKimi K37168 维主干
概念图:展示公开配置能够确认的边界。视频还涉及时间维度的位置表示和帧组织,图中未画出具体采样策略。

三、为什么还要做 PatchMergerV2

图像分辨率升高时,patch 数按面积增长;视频再乘以帧数。若所有视觉 patch 都原样送入 1M-context 主干,会迅速消耗上下文和 attention 预算。Patch merger 用局部合并减少 token 数,让视觉细节与语言推理共享有限序列预算。

压缩存在不可逆取舍。

合并越强,主干越便宜,但小字、细线和密集界面元素越可能丢失。仅知道 merge kernel 为 2×2,不能推出所有输入分辨率下的实际 token 数;还要结合预处理、动态分辨率和视频采样。

四、“原生多模态”比接一个冻结塔多了什么

Kimi K3 报告称 MoonViT-V2 从头训练,并把视觉 token 纳入统一 next-token prediction。与“训练好语言模型后再接冻结视觉塔”的路线相比,主干和视觉接口可以共同适应图文、视频与工具轨迹。

这并不意味着像素和文字从第一层起完全同构:视觉塔仍是专门模块,projector 仍形成清晰边界。“原生”主要描述联合训练与统一目标,而不是没有模态专用组件。

五、公开配置能回答什么,不能回答什么

已公开仍不完整
层数、宽度、头数、patch size、projector、merge 方式、参数规模完整视觉数据混合、分辨率课程、视频采样比例、每阶段损失权重
视觉输入进入 K3 主干的 inference graph所有线上预处理和内容安全链路

因此本文可以准确解释网络接口,但不把它扩写成未经披露的完整视觉训练配方。

评论加载中...