Kimi K3 是什么?基准测试、定价、上下文窗口和开放权重计划
Kimi K3 是月之暗面 (Moonshot AI) 最新旗舰模型,专为长周期编码、代理知识工作、视觉理解和深度推理而设计。该模型于 2026 年 7 月 16 日发布,它结合了 2.8 万亿参数的专家混合 (MoE) 架构、一百万 token 的上下文窗口和异常稀疏的路由设计。
其公布的规格令人印象深刻,但细节至关重要。目前最强的基准测试结果来自月之暗面自己的发布评估,API 输出比早期 Kimi 模型昂贵得多,而且承诺的可下载权重在本文于 2026 年 7 月 23 日发布时尚未提供。本指南将已可用的部分与仍处于发布计划中的部分区分开来。
主要收获
- Kimi K3 是一个 2.8T 参数的多模态 MoE 模型 为每个 token 激活 896 个路由专家中的 16 个。
- 上下文窗口为 1,048,576 token ,具有自动前缀缓存,且对于较长的提示没有更高的 API 价格层级。
- 官方 API 定价为每百万次缓存命中输入 token 0.30 美元,每百万次未缓存输入 token 3.00 美元,每百万次输出 token 15.00 美元。
- 月之暗面报告领先或接近领先的结果 在多项编码、浏览、电子表格、自动化和视觉代理基准测试中,尽管不同模型之间的评估设置不尽相同。
- 权重原定于 2026 年 7 月 27 日发布。 截至 7 月 23 日,检查点、最终许可、文件大小和实际社区部署说明尚未可供检查。
什么是 Kimi K3?
Kimi K3 是月之暗面 (Moonshot AI) Kimi K2 代的后继者,也是该公司迄今为止最大的模型。月之暗面将其描述为首个三万亿参数级别的开放模型。它不仅仅是一个轻量级的聊天模型,更是一个始终保持推理状态的代理,能够在冗长的工程、研究、文档和工具使用工作流程中保持状态。
该模型天生多模态。它通过支持的 Kimi 产品和 API 输入格式接收文本、图像和视频,然后生成文本和工具调用。月之暗面将 K3 定位于三个主要工作负载:长周期软件工程、端到端知识工作以及结合视觉反馈与代码或结构化工具的任务。
Kimi K3 可通过 Kimi.com、Kimi 移动应用程序、Kimi Work、Kimi Code 和 Kimi API 获得。开发人员使用 API 模型 ID kimi-k3。API 文档指出,在成功充值至少 1 美元后,即可解锁旗舰访问权限,速率限制由账户等级决定。
需要更广泛产品家族背景知识的读者可以从 Zerlo 的 Kimi AI 和月之暗面 AI 指南. 开始。K3 是一个模型版本;Kimi 是更广泛的助手、应用程序和开发者生态系统。
Kimi K3 架构:为什么 2.8 万亿参数不等于 2.8 万亿个活跃参数
Kimi K3 采用稀疏专家混合 (Mixture-of-Experts) 设计。网络包含 896 个路由专家,但每个 token 只选择 16 个。这使得模型能够存储大量的专业能力,而无需在每次正向传播时都运行所有专家。完整的检查点仍然需要存储并分布在推理集群中,因此稀疏激活在减少计算方面比减少存储挑战方面更有效。
月之暗面突出四大架构组成部分:
- Kimi Delta Attention (KDA):四个注意力层中有三个使用了线性注意力机制,以提高长序列处理的效率。
- 门控多头潜在注意力:周期中的第四层保留了完整的全局注意力,用于精确的信息检索。
- 注意力残差:块可以有选择地从早期深度检索表示,而不是仅仅依赖于单一的连续累积残差流。
- 稳定的 LatentMoE:支持极端稀疏的 16 选 896 专家配置的专家路由框架。
该公司表示,这些变化,结合更新的训练方法和数据配方,使 Kimi K2 的整体扩展效率提高了大约 2.5 倍。这个数字是月之暗面的说法,而不是独立重现的测量结果。K3 还使用 MXFP4 权重和 MXFP8 激活进行量化感知训练,月之暗面建议使用至少 64 个加速器的超节点部署。
一个简单的存储计算可以说明其规模。以每个参数四个比特计算,2.8 万亿个参数约等于 1.4 TB 的原始权重数据,这还不包括元数据、路由结构、运行时缓冲区、KV 缓存、冗余和框架开销。这就是为什么最终的开放权重发布对研究人员和托管公司来说很有价值,但不会让 Kimi K3 成为一个普通的桌面模型。
Kimi K3 基准测试
月之暗面的发布材料将 Kimi K3 与 GPT-5.6 Sol、GPT-5.5、Claude Fable 5、Claude Opus 4.8 和 GLM-5.2 进行了比较。该公司的总结相对克制:K3 整体上仍落后于最强大的专有系统,但它达到了前沿水平的性能,并在许多单独任务中处于领先地位。
| 基准 | Kimi K3 分数 | 在月之暗面发布图表中的位置 |
|---|---|---|
| DeepSWE | 67.5 | 落后于 GPT-5.6 Sol 和 Claude Fable 5 |
| 终端基准 2.1 | 88.3 | 第二,落后于 GPT-5.6 Sol 0.5 分 |
| 程序基准 | 77.8 | 图表中报告的最高分数 |
| SWE 马拉松 | 42.0 | 图表中报告的最高分数 |
| FrontierSWE | 81.2 | 排在 Claude Fable 5 之后,位居第二 |
| 浏览比较 | 91.2 | 图表中报告的最高分数 |
| 电子表格基准 2 | 34.8 | 领先 Claude Fable 5 0.1 分,最高 |
| 自动化基准 | 30.8 | 图表中报告的最高分数 |

来源: kimi.com
月之暗面报告了特别出色的编码代理结果。K3 在发布图表中领先 Program Bench 和 SWE Marathon,并在 Terminal Bench 2.1 和 FrontierSWE 上接近顶端。
如何解读基准测试声明
这些数字不应被视为一个完全受控的排行榜。月之暗面根据不同的基准测试使用了 Kimi Code、Claude Code 或 Codex 辅助工具。一些竞争对手的结果来自官方排行榜或发布帖子,而其他模型则由月之暗面重新运行。发布表格还指出,Claude Fable 5 可能存在 fallback 行为,GPT-5.6 Sol 在某些任务上存在安全限制中断。
所有 K3 的亮点结果均是在最大推理努力下获得的。这种设置可以提高质量,但也会增加延迟和输出 token 的消耗。一些评估是内部的,包括 Kimi Code Bench 2.0 和部分知识工作评估。在权重和评估工具公开之前,第三方无法完全重现完整的实验结果集。
因此,最有用的解读不是“K3 击败了所有封闭模型”。更好的结论是,K3 在处理长时间运行的编码和代理工作流方面表现出极强的竞争力,在软件工程、浏览、自动化、电子表格和视觉文档任务上取得了出色的第一方结果。实际产品质量仍将取决于指令遵循、延迟、工具集成、安全性行为以及长时间会话的稳定性。

来源: kimi.com
K3 在纯编码之外也取得了强劲的发布日表现,包括在所示的 BrowseComp、AutomationBench 和 SpreadsheetBench 2 比较中位列第一。
Kimi K3 定价
官方 Kimi API 使用三种 token 费率。价格不含税,并以一百万个十进制 token 作为计费单位。
| Token 类别 | 每 1M token 价格 | 适用情况 |
|---|---|---|
| 缓存命中输入 | $0.30 | 重复的提示前缀由 Kimi 的自动上下文缓存提供 |
| 缓存未命中输入 | $3.00 | 需要正常处理的新输入或更改的输入 |
| 输出 | $15.00 | 生成的推理和答案 token 作为输出计费 |
K3 在其上下文范围内提供统一的每 token 定价。一旦请求超过 200K 或类似阈值,不会有单独的附加费用。然而,长提示在绝对值上仍然可能很昂贵,而且一个始终思考的模型可以产生大量输出。一个包含一百万个未缓存输入 token 的请求在输出前将花费 3 美元;相同的缓存前缀将花费 0.30 美元。
自动缓存不需要缓存 ID 或单独的 API 设置。文档指出,之前的提示必须超过 256 个 token,并且后续请求应保持长前缀不变,才能有机会命中缓存。这使得 K3 在对相同存储库、文档集或知识库进行重复分析时比不断变化的单次提示更经济。
Kimi K3 的上下文窗口有多大?
Kimi K3 支持 1,048,576 个 token 的上下文。实际上,这可以容纳非常大的代码库、大量的文档集合、漫长的代理历史记录,或者文本和视觉输入的组合。确切的单词、页面或文件数量因 token 化依赖于语言、格式、源代码和嵌入数据而异。
API 文档列出了默认的 max_completion_tokens 值为 131,072,并允许将其提高到 1,048,576。这个上限不应被解释为生成百万 token 答案的建议。它主要是为异常长的任务流设置的架构上限。
大的上下文窗口也无法保证完美的记忆。月之暗面明确警告说,K3 经过训练可以保留其思考历史。代理框架应将完整的助理消息传回后续回合。丢弃推理历史、在会话中间切换模型或使用不兼容的辅助工具都可能导致生成质量不稳定。
Kimi K3 是开源还是开放权重?
月之暗面称 Kimi K3 为一个“开放”和“开源”的三万亿级模型,但时机至关重要。该公司宣布,完整的权重将于 2026 年 7 月 27 日发布,并附带更多技术细节。本文在截止日期前四天发布。
截至 7 月 23 日,K3 可通过 Kimi 产品和官方 API 使用,但完整的检查点尚未在月之暗面的公共 Hugging Face 组织页面上列出。因此,最终的模型许可证、权重分片、校验和、确切的存储占用、支持的推理引擎以及社区测试的部署程序尚未得到验证。
发布时的精确描述是一个专有的托管模型,承诺将发布开放权重。检查点出现后,许可证将决定是否允许商业使用、修改、再分发和托管服务。开放权重并非自动意味着训练数据、完整的训练代码或可复现的训练管道也将发布。
Zerlo 关于 中国开放权重 AI 生态系统. 的概述更详细地介绍了这一区别。K3 也是与 GLM-5 及其开放权重代理编码方法.
的有用规模比较。
- Kimi.com 和移动应用:通过网页和当前的 iOS、Android 和 HarmonyOS 应用程序进行消费者访问。
- Kimi 工作空间:桌面知识工作环境,K3 在 Windows 和 Apple 芯片 Mac 的 3.1.0 或更高版本中支持。
- Kimi 代码:基于终端的代码访问,用户通过模型菜单选择 K3。
- Kimi API:使用 kimi-k3 模型标识符的 OpenAI 兼容开发者访问。
- Kimi 企业版:具有企业隐私和成员管理功能的企业账户。
- 自托管:计划在权重发布后进行,但实际部署将需要大型多加速器基础设施。
谁应该考虑 Kimi K3?
K3 对于需要代理处理异常庞大工作集(复杂存储库、冗长技术历史、大型 PDF 集合、数据密集型研究、视觉软件工作流或对稳定知识库的重复查询)的团队最有吸引力。其缓存定价旨在奖励这种重复前缀模式。
它不太适合简短、廉价的聊天补全。该模型始终进行推理,输出每百万 token 费用为 15 美元,并且最大努力执行可能比轻量级非推理模型慢。团队应比较总任务成本而非仅输入价格:重试、长时间推理轨迹、工具调用和代理运行时可能比表面上的 token 费率更重要。
主要对开放部署感兴趣的组织应在实际权重和许可证发布之前等待,然后再做出基础设施或合规性决策。即使检查点获得了宽松许可,一个 2.8T 的模型也可能通过专门的推理提供商来使用,而不是下载到普通的台式机上。
限制和未决问题
- 独立验证不完整:在发布日期,完整的检查点尚未公开。
- 基准设置各不相同:不同的辅助工具和引用的第三方评分限制了直接可比性。
- 始终在线的推理可能会增加成本和延迟:较低的努力可能会有帮助,但它不等同于非思考模式。
- 长会话稳定性取决于历史处理:月之暗面警告不要丢弃思考历史或在会话中途切换模型。
- 模型可能过于主动:发布文档建议对不能在狭窄边界之外即兴发挥的应用程序施加明确的行为限制。
- 自托管是一个集群规模的项目:稀疏激活并不能消除存储和分发巨大检查点的需求。
常见问题
什么是 Kimi K3?
Kimi K3 是月之暗面 (Moonshot AI) 的 2.8 万亿参数旗舰多模态模型。它专为长周期编码、研究、工具使用、视觉推理和知识工作而设计,拥有 100 万 token 的上下文窗口。
Kimi K3 API 费用是多少?
官方费率为每百万次缓存命中输入 token 0.30 美元,每百万次未缓存输入 token 3.00 美元,每百万次输出 token 15.00 美元,不含适用税费。
Kimi K3 的上下文窗口是多少?
Kimi K3 支持 1,048,576 个 token 的上下文。API 默认最大完成限制为 131,072 个 token,对于特殊工作负载可提高到 1,048,576 个 token。
Kimi K3 是否可在 Hugging Face 上获取?
截至 2026 年 7 月 23 日发布时,尚未提供。月之暗面表示完整的权重将于 7 月 27 日发布。在此日期之后应再次检查官方 Hugging Face 组织页面。
Kimi K3 能在本地运行吗?
对于消费级硬件来说,它不是一个实用的本地模型。仅粗略的四位权重计算就大约 1.4 TB,还不包括运行时开销,月之暗面建议使用至少 64 个加速器的部署配置。
Kimi K3 比 GPT 或 Claude 更好吗?
从发布数据中无法得出普遍的胜者。K3 在几个报告的编码和代理基准测试中领先,而月之暗面自己也表示该模型整体上仍落后于最强大的专有系统。权重发布后的独立测试将提供更多信息。
Kimi K3 支持图像和视频吗?
是的。K3 具有原生的视觉理解能力,并通过文档记载的 Kimi 产品和 API 格式支持图像和视频输入。API 要求支持上传文件或编码的输入格式,而不是任意的公共图像 URL。
总结
Kimi K3 是 2026 年最具雄心的人工智能模型发布之一:一个 2.8T 稀疏 MoE 模型,具有原生视觉能力、百万 token 上下文窗口、强大的第一方编码和代理基准,以及具有竞争力的缓存输入定价。它已经作为一个托管模型提供,但在 7 月 23 日,开放权重的故事仍是一个承诺,而不是一个可下载的、有许可证的检查点。
开发者现在就可以评估 API,特别是对于受益于自动缓存的重复长上下文工作流。研究人员和基础设施团队应等待 7 月 27 日的权重发布,然后验证许可证、模型文件、支持的服务堆栈和独立基准测试结果,然后才能将 K3 视为可用于生产的开放权重部署。