返回

文章详情

什么是Kimi K3?2026年完整开发者指南

Hacker News2026年8月13日 18:39

Kimi K3是Moonshot AI的新款开源模型,参数量达到2.8万亿。截至2026年8月,它是发布的最大开放权重模型,每个令牌有104B活跃参数,共有896个专家。它支持1,048,576个令牌的上下文窗口(恰好是Kimi K2.7 Code的4倍)。它原生处理文本、图像和视频。Kimi K3在基准测试中与前沿的专有模型如Claude Fable 5和GPT-5.6 Sol势均力敌。你可以通过Hugging Face、OpenRouter、Fireworks AI、Baseten、Together AI或Moonshot自己的平台访问它。大多数第一方提供商对每百万个令牌收费相同的3美元/15美元,而OpenRouter的最便宜路线低于他们。虽然技术上可以自托管,但“可能”意味着至少需要8个企业级加速器,以及高六位数的硬件费用。加密矿工甚至没有足够的硬件来运行K3。我们在OpenCode中运行了Kimi K3,并通过Firecrawl MCP给予了它实时网络访问。Firecrawl MCP扩展了Kimi K3的知识库,并使其能访问实时网络数据。Kimi K3是Moonshot AI最新的开放权重模型,截至2026年8月是发布的最大模型,参数量达到2.8万亿。它继承了Kimi K2.7 Code,原生处理文本、图像和视频,并在单个上下文窗口中承载多达1,048,576个令牌。Moonshot于2026年7月16日开启API访问,并于7月27日发布了完整权重。Kimi K3的规格非常令人印象深刻,尤其是对于一个开源模型。Kimi K3参数量达到2.8万亿。像GLM-5.2和Kimi K2.7 Code的参数量大约在7000亿到刚刚超过1万亿之间。它的架构提供了896个不同的专家,以处理不同任务。它的上下文窗口也超过了1,000,000个令牌。Kimi K2.7 Code的上下文窗口只有262,144,所以K3是其四倍。Kimi K3原生支持文本、图像和视频。总参数量:2.8万亿;每个令牌的激活参数:104B;架构:专家混合(MoE)、稳定潜在MoE;专家数量:896个,总共,按令牌选择16个,共享2个;层数:93(69 KDA + 24门控MLA,1个稠密层);上下文窗口:1,048,576个令牌;量化:MXFP4 MoE专家权重 / MXFP8激活,从SFT开始的量化感知训练(非专家组件保持在更高精度);模态:文本、图像和视频(原生);视觉编码器MoonViT-V2(401M参数);许可证:自定义“Kimi K3许可证”(不是纯MIT)。这些统计数据来自Kimi K3的Hugging Face页面。Moonshot的Kimi K3技术报告将其架构和训练变化(包括Kimi Delta Attention、Attention Residuals和Stable LatentMoE)归功于整体扩展效率较Kimi K2提升了约2.5倍。Kimi的权重于2026年7月27日发布,您可以在Kimi.ai的X帖子中看到。Moonshot AI的技术博客详细介绍了Kimi K3的基准测试,这些测试的结果也与前沿专有模型相当。本节中的所有数字均来源于该博客。有几个轻微变动在发布后修订的arXiv技术报告中,因此如果特定得分对您很重要,值得查看两者。来源:https://www.kimi.com/blog/kimi-k3 DeepSWE:接近与GPT-5.5平局,略微领先67.5比67.0。Kimi K3仅落后于GPT-5.6 Sol(73.0)和Claude Fable 5(70.0)。FrontierSWE:以81.2的得分击败GPT-5.6 Sol、GLM-5.2、Opus 4.8和GPT-5.5,仅次于Claude Fable 5(86.6)。Kimi Code Bench 2.0(内部):在Claude Fable 5(76.9)之后,以72.9的分数排名第二。Terminal Bench 2.1:几乎与GPT-5.6 Sol(88.8)平局,以88.3的得分获得第二名。程序基准:以77.8的得分击败所有其他模型,包括GPT-5.6 Sol(77.6)。SWE马拉松:以42.0分击败所有其他测试过的模型。值得注意的是,Claude Fable 5在35%的这些任务中符合补救措施,拉低了其35.0的得分。来源:https://www.kimi.com/blog/kimi-k3 GDPval-AA V2 Elo:落后于Fable 5和GPT-5.6 Sol,击败所有其他模型。AA-Briefcase Elo:以1548的得分仅次于Claude Fable 5(1583)。自动化基准:击败所有其他模型(30.8)。最接近的竞争者是GPT-5.6 Sol(29.7)。JobBench:以52.9得分排名第二,仅次于Claude Fable 5(57.4)。SpreadsheetBench 2:以34.8的得分击败所有其他模型。Claude Fable以34.7的得分排名第二。BrowseComp:以91.2的得分超越所有其他模型。GPT-5.6 Sol的得分为90.4。在此得分91.2中使用了一种上下文压缩策略;使用完整的1M窗口并没有上下文管理,K3得分为90.4,与Sol平局。来源:https://www.kimi.com/blog/kimi-k3 Kimi K3在所有测试中排名第二,仅次于Claude Fable 5,这两组数据都是使用Python工具辅助的运行。在CharXiv(RQ)中使用Python,Kimi K3得分为91.3,对应Fable 5的93.5。在ZeroBench中使用Python,Kimi K3以41.0打平GPT-5.5,Fable 5得分为46.0,而GPT-5.6 Sol和Claude Opus 4.8都落在40分以下。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡