Kimi K3 正式发布:全球首个 3T 级开源模型,开启前沿智能新时代

今天,我们正式推出 Kimi K3——这是迄今为止能力最强的 Kimi 模型。

Kimi K3 拥有 2.8 万亿参数,基于我们的 Kimi Delta 注意力(KDA)注意力残差(AttnRes) 架构构建,具备原生视觉能力和 100 万 Token 上下文窗口。它是全球首个开源的 3T 级模型,专为长程编码、知识工作和推理等前沿智能场景而设计。

Kimi K3 主视觉图

尽管其整体性能仍落后于最强大的专有模型(Claude Fable 5 和 GPT 5.6 Sol),但 Kimi K3 在我们的评估套件中展现出了前沿级别的性能,始终优于其他接受测试的模型。

Kimi K3 今日已在 Kimi.com、Kimi Work、Kimi Code 和 Kimi API 全面上线。 发布初期,Kimi K3 默认使用最大思考深度(max thinking effort),低强度和高强度模式将在后续更新中推出。我们目前正与推理合作伙伴和开源维护者密切合作,协调技术细节,确保在整个生态系统中可靠部署。完整模型权重将于 2026 年 7 月 27 日发布。 更多架构、训练和评估细节将随 Kimi K3 技术报告一同发布。

---

开源的 3T 级模型

Kimi K3 是首个达到 2.8 万亿参数规模的开源模型。它标志着 Kimi 在规模化前沿持续推进的最新一步:在过去 12 个月中,有 9 个月 Kimi 模型都在不断刷新开源模型的规模上限。

Kimi K3 基于 Kimi Delta 注意力(Kimi Delta Attention, KDA)注意力残差(Attention Residuals, AttnRes) 构建——这两项架构更新旨在改善信息在序列长度和模型深度上的流动。

我们还扩大了混合专家(MoE)的稀疏度,在 Stable LatentMoE 框架下,896 个专家中有效激活 16 个。再加上经过优化的训练和数据配方,这些结构性变化使得整体扩展效率相比 Kimi K2 提升了约 2.5 倍,让模型能够更高效地将计算量转化为智能。

Kimi K3 架构图:Stable LatentMoE 和 KDA 模块(左)、AttnRes 操作(右上)、Block Attention Residuals 骨干网络(右)

---

编码能力

Kimi K3 拥有强大的长程编码性能。在极少人工监督的情况下,它能够持续进行长时间的工程会话、浏览超大规模代码仓库,并协调终端工具。

Kimi K3 还擅长处理软件工程与视觉推理相结合的任务——它利用截图和视觉信息来优化游戏开发、前端开发和 CAD 设计。

以下案例展示了 Kimi K3 的编码能力如何转化为开放式软件创建和科学研究成果。

2.1 内核优化

我们测试了模型优化 GPU 内核的能力。每个模型在相同的沙箱环境中独立工作,拥有最多 24 小时来分析、重写并基准测试四个任务,涵盖 AttnRes、KDA 以及一个 512 头维度的 MLA 内核,测试平台包括 NVIDIA H200 和另一家厂商的通用 GPU(GPGPU)。

Kimi K3 的表现与 Fable 5(含 fallback)相当,并且显著优于 Opus 4.8、GPT 5.6 Sol 和 GPT 5.5。

Claude Fable 5 由第三方评估,其结果可能包含 fallback 行为。在大多数模型中,某些运行轨迹包含一些可接受的精度捷径,但仍在我们的数值容差范围内。GPGPU 指用于图形渲染之外计算的通用图形处理器。
在 Kimi K3 开发的后期阶段,一个早期版本的 Kimi K3 承担了团队大部分的内核优化工作。

2.2 GPU 编译器开发

我们进一步测试了 Kimi K3 是否能从零开始构建一套 GPU 编程系统。Kimi K3 开发了 MiniTriton——一个类 Triton 的紧凑编译器,拥有自己基于 MLIR 的 Tile 级 IR 层、优化 Pass 和 PTX 代码生成管线。

在支持的 Roofline 基准测试中,MiniTriton 的性能与 Triton 和 torch.compile 相当甚至更优——在某些工作负载上超越了 Triton。

MiniTriton 在 NVIDIA L20 上的 CUDA Core Roofline 图

除了微基准测试之外,MiniTriton 还能端到端地进行 nanoGPT 训练且收敛稳定,损失曲线与参考值高度吻合,仅有微小偏差——这验证了整个管线在真实工作负载上的有效性。这些结果表明,Kimi K3 能够构建一个连贯的端到端编译器——从 DSL 前端和 IR Pass 到 PTX 代码生成和运行时——而不仅仅是孤立的内核;其从零开始构建的 Tensor Core 路径已经能与 Triton 经过大量优化的技术栈相媲美。

2.3 游戏开发与数字创作

Kimi K3 结合了强大的 3D 推理、编码和视觉能力,能够将概念、图像和视频转化为完全可玩的互动体验。Kimi K3 通过在代码和实时截图之间无缝迭代,实现了真正的「视觉在环」(vision in the loop),能够即时查看和优化输出。

Kimi K3 展示:游戏开发与数字创作

2.4 芯片设计

作为早期概念验证,Kimi K3 设计了一款为基于其自身架构的纳米模型服务的芯片。在单次 48 小时的自主运行中,K3 使用 Nangate 45nm 工艺库上的开源 EDA 工具,完成了芯片的构建、优化和验证。

在不到 4 平方毫米的面积内,该芯片在 100MHz 下完成时序收敛,仿真中维持超过 8,700 Token/s 的解码吞吐量,集成了 146 万标准单元、0.277MB SRAM,以及一个带融合反量化的 INT4 MAC 阵列。

由模型设计、为模型服务的芯片——这折射出 K3 的长程智能体能力。

2.5 科研编码

Kimi K3 架起了科学文献与可执行代码之间的桥梁,能够自主实现、验证和分析复杂的计算科研工作流。

在一个案例中,Kimi K3 用约两小时完成了通常需要一位经验丰富的研究员一到两周的工作。为了复现计算天体物理学中的 I-Love-Q 普适关系,它:

  • 查阅并交叉验证了 20 多篇论文
  • 实现了完整的数值计算管线
  • 评估了 300 多个物态方程
  • 发现了已发表公式中的不一致之处
  • 生成了 3,000 多行 Python 代码
  • 制作了一个交互式 HTML 仪表板用于探索结果

---

知识工作

Kimi K3 推动了端到端知识工作的进步。在公开基准测试之外,Kimi K3(max 模式)在我们的内部评估中展现出持续的提升——这些评估源自真实用户-智能体工作流中反复出现的模式和挑战。这些在不同生产导向工作流中的一致优势,反映了 Kimi K3 在智能体知识工作能力上的全面提升。

内部知识工作基准测试

3.1 交互式可视化研究

以下是 Kimi K3 在 Kimi Work 中能够产出的几个例子,涵盖金融咨询和科学研究领域:

案例 1:42 年 AI ASIC 产业研究交互式网站

一份可以深入探索的交互式研究报告:42 年的 ASIC 产业史,通过 120 多轮递归自我完善生成。Kimi K3 将证据转化为定制图表、动画图示和交互式视觉叙事。它通过 2,800 多次网页搜索/抓取和 1,100 多次终端数据拉取获取数据,涵盖 11,000 多页内容,包括 87 份季度报告和 99 份原始 PDF。

案例 2:核聚变产业研究

一份咨询风格的产业报告,配有交互式可视化——包括时间线、漏斗图、范围条形图、甘特图,以及可发表质量的幻灯片。

案例 3:GWTC-5 引力波分析

使用 20 多个并发子智能体对 391 个引力波事件进行分析,产出 7 张科学可视化图表、2 个表格,以及基于 10 多篇论文的文献综述。

Kimi K3 在制作信息图风格的演示文稿方面同样出色,例如下面展示的完全可编辑的热力图和年度报告:

Kimi K3 展示:可视化研究与信息图

3.2 小组件与仪表盘

在 Kimi Work 中,我们引入了两个新功能——小组件(Widgets)仪表盘(Dashboard)——让与 Kimi K3 的交互更具视觉性和持续性。

小组件让你可以直接在对话中生成交互式组件,并连接到本地数据或外部插件以实现持续更新。仪表盘将你最关心的小组件整合到一个持久的、个性化的视图中,围绕某个主题、项目或目标进行组织。

3.3 视频编辑

Kimi K3 擅长动效设计、动画制作和视频编辑,因为它的原生多模态架构能够在同一个模型中理解文本、图像和视频。

在一个例子中,K3 创作了一个 3Blue1Brown 风格的动效讲解视频,介绍它自己的架构,将技术思想转化为动画图表和转场效果。

在另一个例子中,Kimi K3 从 56 个源片段中剪辑出了它自己的预告片,处理了片段选择、运动匹配剪辑、帧精确的节拍同步、音频处理,以及多轮修改。像这样的高密度短视频,通常需要一位经验丰富的剪辑师 1-2 个工作日,或者初学者 3-5 天。

---

架构与基础设施

Kimi K3 基于 Kimi Delta 注意力(KDA)注意力残差(AttnRes) 构建。KDA 为注意力扩展提供了高效的基础,而 AttnRes 则跨深度选择性地检索表征,而不是均匀地累积它们。它们共同构成了一个设计用于超越万亿参数规模高效扩展的模型架构骨干。

Kimi K3 使用 Stable LatentMoE,896 个专家中有效激活 16 个。在这种稀疏度水平下,路由和优化成为首要挑战。分位数平衡(Quantile Balancing) 直接从路由分数分位数推导专家分配,消除了启发式更新和敏感的平衡超参数;而 Per-Head Muon 通过独立优化注意力头来扩展 Muon,实现更大规模下的更自适应学习。Sigmoid Tanh 单元(SiTU)门控 MLA 分别改善了激活控制和注意力选择性。这些进步共同实现了 2.8 万亿参数规模下的稳定高效训练。

Kimi K3 从 SFT 阶段起就应用了量化感知训练,使用 MXFP4 权重和 MXFP8 激活,以实现广泛的硬件兼容性。为了防止专家不平衡在大规模专家并行下降低吞吐量,我们引入了一种完全平衡的专家并行训练方法,采用静态形状,关键路径上无需主机同步。

由于推理效率同样受益于更大的高带宽通信域,我们建议在配备 64 个或更多加速器的超级节点配置上部署 Kimi K3。最后,由于 KDA 对传统前缀缓存提出了新的挑战,我们已向 vLLM 社区贡献了相应的实现,将与模型一同发布。KDA 配合预填充缓存,让我们尽管模型规模大、上下文长,仍能以极具竞争力的 Token 价格提供 Kimi K3 服务。

更多技术细节将在我们即将发布的技术报告中公布。

---

可用性

  • Kimi K3 智能体: 从应用商店下载或更新最新版 Kimi 应用(支持 iOS、Android、鸿蒙),或访问 kimi.com
  • 用 Kimi K3 工作: 下载最新版 Kimi Work 桌面应用(3.1.0 或更高版本),支持 Windows 和 Apple Silicon Mac
  • 用 Kimi K3 写代码: 在终端中运行 Kimi Code,使用 /model 命令选择 Kimi K3
  • 用 Kimi API 构建: 访问 Kimi API 平台,选择 kimi-k3。定价为:缓存命中输入 $0.30/百万 Token,缓存未命中输入 $3.00/百万 Token,输出 $15.00/百万 Token。由 Mooncake 的分离式推理架构提供支持,官方 Kimi API 在编码工作负载中的缓存命中率超过 90%
  • 企业级 Kimi: Kimi Enterprise 提供企业级数据隐私和成员管理,个人账户与组织账户完全分离。访问定价页面并选择「获取 Kimi Enterprise」为您的团队订阅

---

完整基准测试表

Kimi K3 基准测试对比(编码)

Kimi K3 基准测试对比(生产力与多模态)

---

脚注

以下报告的所有 Kimi K3 结果均在推理深度设为「max」、温度 = 1.0、top-p = 1.0 的条件下获得。根据基准测试的不同,每个模型在三种智能体环境(KimiCode、Claude Code 或 Codex)之一下进行评估,具体说明见下文注释。

7.1 编码基准测试

  • DeepSWE:Kimi K3 使用 KimiCode 环境评估。GLM-5.2 分数来自 GLM-5.2 发布博客;其余分数来自 DeepSWE 官方排行榜,在该榜单上 Kimi K3 使用 mini-SWE-agent 环境取得 67.3 分。我们报告 DeepSWE v1.1 任务集的结果。
  • Terminal-Bench 2.1:Kimi K3 使用 KimiCode 环境评估。其他模型报告各环境下的最佳成绩:GLM-5.2 使用 Claude Code;Claude Opus 4.8 和 Claude Fable 5 使用 Terminus 2;GPT 5.5 和 GPT 5.6 Sol 使用 Codex。
  • Program Bench:Kimi K3 使用 KimiCode 环境评估。GLM-5.2 分数来自 GLM-5.2 发布博客;其他分数来自 vals.ai 官方基准。
  • SWE Marathon:Kimi K3、Claude Opus 4.8 和 Claude Fable 5 使用 Claude Code 环境评估;GPT-5.6 Sol 使用 Codex 环境评估。GLM-5.2 分数来自 GLM-5.2 发布博客。我们的评估基于官方 v1.1 任务的 H20 校准分支:Docker 镜像、性能门控和 GPU 任务的参考预言机已针对 H20 重新校准,而正确性和反作弊验证器保持不变。此外,Claude Fable 5 在我们的评估中有 35% 的任务触发了 fallback,这可能对其测得的性能产生了负面影响。
  • FrontierSWE:Kimi K3 使用 KimiCode 环境评估,GPT-5.6 Sol 使用 Codex 环境评估;其他结果来自 frontierswe.com 官网。优势分数使用官方评估脚本从原始分数重新计算,数据截至 2026 年 7 月 16 日。
  • PostTrain Bench:GLM-5.2、GPT-5.5 和 Claude Opus 4.8 的分数采用自 PostTrainBench 官方结果。Kimi K3、Claude Fable 5 和 GPT-5.6 Sol 使用官方 Harbor 实现以最大推理深度评估,在 H20 GPU 上运行三次取平均(而非官方设置中的 H100)——Kimi K3 和 Claude Fable 5 使用 Claude Code 环境,GPT-5.6 Sol 使用 Codex 环境。
  • MLS Bench Lite:Kimi K3 使用 KimiCode 环境评估;GLM-5.2 和 Claude 系列模型使用 Claude Code 环境;GPT-5.5 和 GPT-5.6 Sol 使用 Codex 环境。
  • KCB 2.0:Kimi K3 同时使用 KimiCode 和 Claude Code 两种环境评估;GLM-5.2、Claude Opus 4.8 和 Claude Fable 5 使用 Claude Code 环境;GPT-5.5 和 GPT-5.6 Sol 使用 Codex 环境。所有模型均以最大推理深度评估,GPT-5.5 除外,它使用「xhigh」设置。我们还注意到,在此内部基准测试中,10% 的任务进入了 GPT-5.6 Sol 的安全防护(cyber guard)。

7.2 生产力与智能体基准测试

  • 对于 OfficeQA Pro,每个测试用例为智能体提供完整的 PDF 语料库,所有 PDF 均渲染为图像,没有机器可读文本。
  • OfficeQA Pro 和 SpreadsheetBench 2:Kimi K3、GLM-5.2、Claude Opus 4.8 和 Claude Fable 5 使用 Claude Code 环境评估;GPT 5.5 和 GPT 5.6 Sol 使用 Codex 环境评估。
  • MCP Atlas:所有模型在 500 个任务的公开子集上评估,限制 100 轮对话,使用 Gemini 3.1 Pro 作为评判模型。
  • AutomationBench:所有模型在 600 个任务的公开子集上评估,其他方面均遵循官方 GitHub 设置。
  • BrowseComp:我们采用 Claude 模型卡中使用的上下文压缩策略,在 30 万 Token 时触发。当使用 100 万 Token 上下文窗口且无上下文管理时,Kimi K3 得分为 90.4。Claude Fable 5、Claude Opus 4.8、GPT 5.6 Sol 和 GPT 5.5 的结果引自 Anthropic 和 OpenAI 官方发布。
  • GDPval-AA v2 和 AA-Briefcase 分数引自 artificialanalysis.ai。

7.3 多模态基准测试

  • ZeroBench 遵循官方设置并运行 5 次外,所有多模态分数均为三次运行的平均值。MMMU-Pro 遵循官方协议进行评估,保留原始输入顺序并将图像前置到文本输入之前。
  • PerceptionBench:PerceptionBench 是我们的内部基准测试,专注于原子级视觉感知能力。

---

局限性

  • 对思考历史的敏感性:K3 是在「保留思考历史」模式下训练的。如果智能体环境未能按要求传递所有历史思考内容,或者从其他模型的进行中会话切换到 K3,生成质量可能会变得高度不稳定。我们建议使用经过验证的兼容性环境(如 Kimi Code),并避免在会话中途切换到 K3。

  • 过度主动:K3 的训练特别强调长程、高难度任务。因此,在任务执行过程中遇到小问题或用户意图模糊时,它可能会替用户做出意想不到的决定。如果您的应用要求智能体在明确定义的边界内运行、避免过度即兴发挥,请在系统提示词或 AGENTS.md 中对 K3 施加更明确的行为约束。

  • 尽管整体而言 K3 是一款极具竞争力的模型,但与 Claude Fable 5 和 GPT 5.6 Sol 相比,它在用户体验方面仍存在明显差距。

---

官方来源:

ESC

输入关键词开始搜索

支持搜索标题、内容、标签