月之暗面 · Kimi K3 · 2026 年 7 月

Kimi K3 — 支持百万级上下文的长周期编码旗舰

  • 百万级上下文
  • 原生视觉输入
  • 自带深度推理
  • 长程 Agent 取向
Kimi K3

Kimi K3 是什么?

Kimi K3 是月之暗面在 2026 年 7 月发布的开放前沿旗舰,面向长程编码、知识工作与 Agent 工作流。相对 Kimi K2.6,上下文升到百万级,并强调原生视觉与始终可调的深度推理。日常高周转可对照更轻的同族型号;顶格闭源对照可看 Claude Opus 5 或 GPT-5.6 Sol。在 iMini Agent 里选 Kimi K3 即可使用。

厂商
月之暗面
发布
2026 年 7 月
上下文
1M tokens
最大输出
按平台上限
深度推理
自带开启 · 可调
适合作为
中英长上下文旗舰主力

相对 Kimi K2.6,升级了什么

上下文、视觉与深度推理——设为 Kimi 旗舰前最该看清的变化。

上下文升到百万级

相对 K2.6 的约 256K,长规格与大仓库材料可以留在同一条线程里推进。

原生视觉输入

图像可直接进入推理过程,适合带着截图、图表与界面一起编程或做分析。

自带深度推理

困难任务可把推理档位拉高;日常仍可选用较低档换速度。

长程 Agent 取向更强

面向编码、研究与多步工具协作,适合把目标保持到可交付结果。

官方评测

Moonshot 在 Kimi K3 技术博客公布的评测图。所有对照模型均按最高思考强度(max / xhigh)评测。

Kimi K3 内部知识工作评测:Online Exp、DECK、Finance
内部知识工作三项。Online Exp Bench 75.5、DECK-Bench 73.5、Finance-Bench 62.6,均高于同屏的 GPT-5.5 与 Claude Opus 4.8——知识整理与金融材料是 K3 的强项之一。
Kimi K3 Agent / 工具使用相关评测
Agent 与工具相关评测。把多步工具调用、浏览与自动化任务摊开,用来判断 K3 能否在真实工作流里把任务跑完,而不只看单次问答。
Kimi K3 视觉与文档理解评测
视觉与文档理解。原生多模态能力的对照;读图、读表、读长文档时,和纯文本分数要分开看。
Kimi K3 推理评测对照
推理类基准对照。与 Claude Fable 5、GPT-5.6 Sol 等同屏;K3 在开放权重里靠前,但仍明确落后于最强闭源几档。
Kimi K3 编程评测:DeepSWE、FrontierSWE、Terminal Bench 等
编程六项。DeepSWE 67.5、FrontierSWE 81.2、Terminal Bench 2.1 88.3、Program Bench 77.8、SWE Marathon 42.0;多项高于 Opus 4.8,整体仍低于 Fable 5 / GPT-5.6 Sol 顶尖档。
Kimi K3 补充评测图
补充评测。与主表一并阅读;方法说明里会写明 harness 与竞品取数来源,跨厂商对比时以方法为准。

三种常见用法

Kimi K3 更适合中英环境下的长材料与长程任务。

长程编码

用于跨文件改功能、修测试与仓库级改造。适合打开更高推理档位。

带图的知识工作

用于读截图、整理图表与写决策备忘。重点在引用可见依据。

多步 Agent

用于工具调用与研究型自动化。适合事先约定成功标准与中止条件。

和 Kimi K2.6、GLM 5.2 怎么选

三款都偏中文与开源路线。差别主要在上下文、视觉与旗舰代际。

对比项Kimi K3Kimi K2.6GLM 5.2
上下文1M tokens约 256K tokens1M tokens
推理方式自带深度 · 可调多子代理编排取向Thinking High / Max
编程与 Agent长程编码旗舰长程编码与多子代理编排开源 coding / agent 旗舰
长程工具协作视觉 + 长线程多子代理编排长程交付取向
速度取向可降档换速度长跑任务更重可调思考预算
更适合优先选用新增 Kimi 旗舰任务仍绑定 K2.6 工作流时绑定智谱栈时

在 iMini 上使用 Kimi K3

关于免费额度、型号选择、主要规格,以及和 K2.6、GLM 怎么区分。

在 iMini Agent 免费使用 Kimi K3

百万级上下文,原生视觉,适合长程编码与知识工作。

打开 Kimi K3

无需月之暗面 API Key。