文章摘要
Kimi K3是Moonshot AI发布的最大开源权重模型,基于去年Kimi Linear模型扩展至2.8B参数。其核心创新是LatentMoE,通过压缩大线性层提升推理效率,与Nemotron 3和DeepSeek V4等模型趋势一致。
文章总结
Kimi K3架构笔记:昨日发布的大型开源权重模型架构图及相关观察。
架构看似复杂,但本质上是去年发布的Kimi Linear模型的规模化生产版本(从48B扩展至2.8T参数;K3是目前最大的开源权重模型)。
与Kimi Linear相比,新增组件为LatentMoE(潜在混合专家模型)。其原理类似于多头潜在注意力机制,通过压缩(降维)大型线性层来提升效率。
Kimi K3的整体趋势(与Nemotron 3、DeepSeek V4等类似)是提升推理效率。许多组件被替换为效率优化版本,例如MoE→LatentMoE,常规注意力→多头潜在注意力和Kimi Delta注意力。
唯一非效率优化的组件变化是注意力残差。与DeepSeek V4通过mHC(流形约束超连接)拓宽残差路径不同,注意力残差通过跨层连接残差,并利用注意力分数作为重要性/贡献权重。据报告,这能持续改善验证损失和下游性能,但增加约4%的训练成本和2%的推理成本。
有趣的是,Kimi K3完全去除了所有RoPE层,全面采用NoPE(无位置嵌入)。这继承自Kimi Linear。在其他架构中,近期趋势是在局部注意力层(如滑动窗口注意力)使用RoPE,在全局层使用NoPE。虽然此前有少数架构完全使用NoPE,但据我所知,这是首个达到前沿水平的模型。
Kimi K3现已原生支持多模态,这是一大亮点。
技术报告中还有其他有趣的训练细节,但架构方面目前就这些。总体而言,这是一次非常出色的发布。
评论总结
根据评论内容,主要观点如下:
观点一:模型采用全局NoPE(无位置编码)策略,与主流做法不同
- 关键引用:
- "Interesting that they went NoPE everywhere — everyone else hedges with RoPE in the local layers."
- "有趣的是,他们到处都用了NoPE——其他所有人都在局部层用RoPE来对冲。"
观点二:线性注意力机制(如Kimi Delta)可能隐式承担了位置编码功能
- 关键引用:
- "Feels like the linear-attention stuff (Kimi Delta) is quietly doing the positional work so they can get away with it."
- "感觉线性注意力(Kimi Delta)在悄悄做位置编码的工作,所以他们才能这样搞。"
观点三:对模型在更大规模下的表现持观望态度
- 关键引用:
- "Curious to see if it holds up at frontier scale."
- "好奇它在前沿规模下是否还能撑住。"
总结:评论者指出该模型全面采用NoPE,不同于主流在局部层使用RoPE的做法,推测线性注意力机制可能隐式处理了位置信息,但对模型在更大规模下的有效性表示谨慎期待。