文章摘要
Kimi团队提出了一种名为Kimi Linear的新型注意力架构,兼具高表达力与高效性。
文章总结
Kimi Linear是一种创新的混合线性注意力架构,首次在多种场景(包括短上下文、长上下文和强化学习扩展)的公平比较中超越了全注意力机制。其核心是Kimi Delta Attention(KDA),一种表达力更强的线性注意力模块,通过更精细的门控机制扩展了Gated DeltaNet,从而更有效地利用有限的有限状态RNN内存。我们定制的分块算法利用对角加低秩(DPLR)转换矩阵的特殊变体,实现了高硬件效率,相比通用DPLR公式大幅减少了计算量,同时更符合经典delta规则。
我们基于KDA和多头潜在注意力(MLA)的逐层混合,预训练了一个具有30亿激活参数和480亿总参数的Kimi Linear模型。实验表明,在相同训练方案下,Kimi Linear在所有评估任务上显著优于全MLA,同时将KV缓存使用量减少高达75%,并在1M上下文下实现高达6倍的解码吞吐量。这些结果证明,Kimi Linear可以作为全注意力架构的直接替代品,在性能和效率上更优,尤其适用于长输入和输出长度的任务。
为支持进一步研究,我们开源了KDA内核和vLLM实现,并发布了预训练和指令微调的模型检查点。
评论总结
根据评论内容,总结如下:
主要观点与论据:
对Kimi Linear论文的认可与关联性(评分:无)
- 评论4指出,新发布的Kimi K3论文“heavily based on Kimi Linear discussed here”,表明该研究具有持续影响力。
- 评论2称赞“Another banger from Zhang et. al”,表达对作者团队的肯定。
技术演进与实用性(评分:无)
- 评论5提到,基于Kimi Linear创建内部模型后,发现Gated Deltanet 2“seems like an evolution of it in expressiveness”,并在测试中表现更优。
- 评论7赞赏开源行为:“open-source the KDA kernel and vLLM implementations... This is just awesome”,强调开放生态的价值。
对模型智能涌现的质疑(评分:无)
- 评论6提出核心疑问:是否前沿模型的智能仅是“emerging phenomena”,通过规模扩展实现?并对比传统算法(如排序)无法通过暴力计算突破,质疑LLM领域“race to scaling up”的合理性。
对蒸馏攻击观点的反驳(评分:无)
- 评论3明确表示:“If you want to believe that the success of Kimi is about distillation attacks, ignore this”,否定将成功归因于蒸馏攻击的说法。
平衡性说明: - 正面观点:强调论文的延续性、技术演进和开源贡献。 - 质疑观点:对规模扩展的智能涌现机制提出根本性质疑。 - 反驳观点:直接否定蒸馏攻击的归因。
关键引用保留: - 评论4:“heavily based on Kimi Linear discussed here” - 评论5:“seems like an evolution of it in expressiveness” - 评论6:“isn't it weird that the 1 million parameter model... can't solve basic puzzles but suddenly the 1 trillion parameter can conjure up counter-examples” - 评论3:“If you want to believe that the success of Kimi is about distillation attacks, ignore this”