Kimi Linear:一种富有表现力且高效的注意力架构
作者:Kimi团队:Yu Zhang, Zongyu Lin, Xingcheng Yao, Jiaxi Hu, Fanqing Meng, Chengyin Liu, Xin Men, Songlin Yang, Zhiyuan Li, Wentao Li, Enzhe Lu, Weizhou Liu, Yanru Chen, Weixin Xu, Longhui Yu, Yejie Wang, Yu Fan, Longguang Zhong, Enming Yuan, Dehao Zhang, Yizhi Zhang, T.Y. Liu, Haiming Wang, Shengjun Fang, Weiran He, Shaowei Liu, Yiwei Li, Jianlin Su, Jiezhong Qiu, Bo Pang, Junjie Yan, Zhejun Jiang, Weixiao Huang, Bohong Yin, Jiacheng You, Chu Wei, Zhengtao Wang, Chao Hong, Yutian Chen, Guanduo Chen, Yucheng Wang, Huabin Zheng, Feng Wang, Yibo Liu, Mengnan Dong, Zheng Zhang, Siyuan Pan, Wenhao Wu, Yuhao Wu, Longyu Guan, Jiawen Tao, Guohong Fu, Xinran Xu, Yuzhi Wang, Guokun Lai, Yuxin Wu, Xinyu Zhou, Zhilin Yang, Yulun Du 查看PDF 摘要:我们介绍Kimi Linear,这是一种混合线性注意力架构,首次在各种场景下的公平比较中超越了全注意力——包括短上下文、长上下文和强化学习(RL)扩展模式。它的核心是Kimi Delta Attention(KDA),这是一种富有表现力的线性注意力模块,它在更细粒度的门控机制下扩展了Gated DeltaNet,使有限的有限状态RNN内存的使用更加高效。我们定制的分块算法通过一种特殊的对角加低秩(DPLR)过渡矩阵变体实现了高硬件效率,相比于一般的DPLR公式,大幅减少了计算量,同时与经典的增量规则更为一致。我们预训练了一个具有30亿激活参数和480亿总参数的Kimi Linear模型,基于KDA和多头潜在注意力(MLA)的分层混合。我们的实验表明,在相同的训练配方下,Kimi Linear在所有评估任务上都大幅超越了全MLA,同时将KV缓存使用量减少高达75%,并在1M上下文中实现了最多6倍的解码吞吐量。这些结果表明,Kimi Linear可以成为全注意力架构的替代品,且在性能和效率方面更优,适用于输入和输出长度较长的任务。为了支持进一步的研究,我们开源了KDA内核和vLLM实现,并发布了预训练和指令调整的模型检查点。 评论:Kimi Linear 技术报告 主题:计算与语言(cs.CL);机器学习(cs.LG) 引用为:arXiv:2510.26692 [cs.CL] (或arXiv:2510.26692v2 [cs.CL] 本版本) https://doi.org/10.48550/arXiv.2510.26692 arXiv-颁发的DOI通过DataCite 提交历史 来自:Yulun Du [查看电子邮件] [v1] 2025年10月30日星期四 16:59:43 UTC (645 KB) [v2] 2025年11月1日星期六 12:05:18 UTC (691 KB)
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡