返回

文章详情

Kimi K3 架构概述与注释

Hacker News2026年7月28日 15:48

Kimi K3 架构图用于昨天的大型开放权重模型发布,以及一些观察和想法。是的,它看起来相对复杂,但它本质上是他们去年发布的 Kimi Linear 模型的放大生产版本(从 48B 放大到 2.8T;K3 现在是最大的开放权重模型)。与 Kimi Linear 相比,唯一的新组件是 LatentMoE。我在下面的图中省略了它,因为已经非常拥挤,但它基本上是与 Nemotron 3 Ultra 中相同的 LatentMoE(如果你有兴趣,可以在我的 LLM 架构画廊中找到)。这里的想法是压缩(下投影)大型线性层,类似于多头潜在注意力。Kimi K3 的总体趋势(与 Nemotron 3、DeepSeek V4 等相似)也是朝着更好的推理效率。也就是说,有许多组件用效率调整版本替换现有组件。即,MoE -> LatentMoE,常规注意力 -> 多头潜在注意力和 Kimi Delta Attention。(如果你对其他细节感兴趣,我的画廊中也有简短的教程和写作)。一个非效率调整的组件变化是注意力残差。正如 DeepSeek V4 用 mHC(流形约束超连接)改进了残差路径一样,注意力残差是一种改进残差路径的方法,但它的工作方式略有不同。即,mHC 使残差路径更宽。注意力残差(也已是 Kimi Linear 的一部分)跨层连接残差;连接本身使用注意力分数作为重要性/贡献权重。根据报告,它在验证损失和下游性能上(略微)一致改善,并增加了大约 4% 的训练成本和 2% 的推理成本。有趣的是,Kimi K3 去掉了所有 RoPE 层,而在各处使用了 NoPE(无位置嵌入)。 (再次,这来自 Kimi Linear)。在其他架构中,最近的趋势是在局部注意力层(如滑动窗口注意力)中使用 RoPE,而在全局层中使用 NoPE。虽然有一些架构在各处仅使用 NoPE,但就我所知,这是第一个前沿级别的架构。Kimi K3 现在也具有原生多模态支持,这很不错!技术报告中还有几个其他有趣的训练细节,但到目前为止,架构方面就是这样。整体上是一个真正很棒的发布。图 1. Kimi K3 架构与发布时基准比较。有关更多详细信息,请参见架构画廊中的 K3。来源:我 Substack 笔记的网页版本。接下来阅读 本周几个显著的开放权重模型 关于六个新开放权重模型(包括 Nanbeige 4.2、Laguna S 2.1、Motif-3-Beta、Solar Open 2、Antares 1B 和 BTL-3)的架构短笔记。构建推理模型从头开始中的清单 6.5 的更正 关于构建推理模型从头开始第 198 页清单 6.5 中随机种子的简短更正。Inkling: 一个新的 975B MoE 开放权重模型,包含一些惊喜 关于 Thinking Machines Lab 的 975B Inkling 模型的简短笔记,包括基准测试、稀疏 MoE 设计、短卷积、RMSNorm 和位置偏置。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡