一、视觉编码器解决的是“怎样进入语言主干”
语言模型不能直接读取像素。视觉编码器把二维图像或视频帧转换成一串具有语义的向量,再通过 projector 对齐到语言模型隐藏维度。
MoonViT-V2 延续 Vision Transformer 的 patch 化思路。它不是一个独立生成图像的 diffusion decoder,也不是完整 Kimi K3;它负责感知和接口转换,后续推理、工具使用和文本生成由 K3 主干完成。
二、从像素到 Kimi token 的数据流
公开配置显示 patch size 为 14,视觉塔 27 层、hidden size 1024、12 个注意力头;PatchMergerV2 将视觉 token 合并,再由多模态 projector 映射到 7168 维文本空间。
三、为什么还要做 PatchMergerV2
图像分辨率升高时,patch 数按面积增长;视频再乘以帧数。若所有视觉 patch 都原样送入 1M-context 主干,会迅速消耗上下文和 attention 预算。Patch merger 用局部合并减少 token 数,让视觉细节与语言推理共享有限序列预算。
合并越强,主干越便宜,但小字、细线和密集界面元素越可能丢失。仅知道 merge kernel 为 2×2,不能推出所有输入分辨率下的实际 token 数;还要结合预处理、动态分辨率和视频采样。
四、“原生多模态”比接一个冻结塔多了什么
Kimi K3 报告称 MoonViT-V2 从头训练,并把视觉 token 纳入统一 next-token prediction。与“训练好语言模型后再接冻结视觉塔”的路线相比,主干和视觉接口可以共同适应图文、视频与工具轨迹。
这并不意味着像素和文字从第一层起完全同构:视觉塔仍是专门模块,projector 仍形成清晰边界。“原生”主要描述联合训练与统一目标,而不是没有模态专用组件。
五、公开配置能回答什么,不能回答什么
| 已公开 | 仍不完整 |
|---|---|
| 层数、宽度、头数、patch size、projector、merge 方式、参数规模 | 完整视觉数据混合、分辨率课程、视频采样比例、每阶段损失权重 |
| 视觉输入进入 K3 主干的 inference graph | 所有线上预处理和内容安全链路 |
因此本文可以准确解释网络接口,但不把它扩写成未经披露的完整视觉训练配方。
评论加载中...