xAI · Grok 4.5 · 2026 年 7 月

Grok 4.5 — 集成实时搜索与代码执行的编程模型

  • 50 万级上下文
  • 推理更省 token
  • 可接搜索与执行
  • 贴近编辑器编程
Grok 4.5

Grok 4.5 是什么?

Grok 4.5 是 xAI 在 2026 年 7 月发布的型号,侧重编辑器场景下的多步编程,并可把网页搜索、X 搜索与代码执行接入同一条工作流。相对 Grok 4.3,更强调这类工具协作与 token 效率;上下文为 50 万级,材料特别长时可对照仍提供百万级上下文的 Grok 4.3。在 iMini Agent 里选 Grok 4.5 即可使用。

厂商
xAI
发布
2026 年 7 月
上下文
500K tokens
最大输出
按平台上限
深度推理
更省 token · 可接工具
更适合
编程、检索与代码执行

相对 Grok 4.3,升级了什么

Agent 能力、token 效率,以及编辑器场景——当作主力前最该看清的变化。

多步编程更强

官方将 4.5 定位为更强的编程与工具协作型号,适合多步修改与接工具的任务。

推理更省 token

在相近质量下更克制地消耗 token,适合高周转工具循环。

工具面完整

可接函数调用、网页搜索、X 搜索与代码执行,便于把检索与执行放进同一条工作流。

贴近编辑器编程

与 Cursor 等产品场景联合训练,更贴近 IDE 里改仓库、做多步修改的习惯。

官方评测

xAI 在 Grok 4.5 发布文中公布的工程评测,与 Claude Fable 5、Claude Opus 4.8、GPT-5.5 等同屏对照。竞品分数取自各厂商公开系统卡或排行榜。

DeepSWE 1.0:Grok 4.5 与 Fable、GPT-5.5、Opus 的对照
DeepSWE 1.0(pass@1)。Grok 4.5 为 62.0%,高于 Claude Opus 4.8(55.75%),低于 Claude Fable 5(66.1%)与 GPT-5.5(64.31%)。评测由 Datacurve 创建、AA 用各厂商 harness 跑出。
DeepSWE 1.1:Grok 4.5 评测对照
DeepSWE 1.1。Grok 4.5 为 53.0%,低于 Claude Fable 5(70%)、GPT-5.5(67%)与 Claude Opus 4.8(59%),高于 GLM 5.2(44%)。同一家族的两版 DeepSWE 都要看,不能只挑高分。
Terminal Bench 2.1:Grok 4.5 评测对照
Terminal Bench 2.1。Grok 4.5 为 83.3%,与 GPT-5.5(83.4%)几乎持平,高于 Claude Opus 4.8(78.9%),略低于 Claude Fable 5(84.3%)。终端 Agent 场景的核心对照之一。
SWE Bench Pro:Grok 4.5 解决率对照
SWE Bench Pro 解决率。Grok 4.5 为 64.7%,高于 GPT-5.5(58.6%)与 GLM 5.2(62.1%),低于 Claude Fable 5(80.4%)与 Claude Opus 4.8(69.2%)。

三种常见用法

Grok 4.5 更适合要把编程、检索和执行串在一起的工作。

IDE 里多步编程

用于多步改功能、修测试与工具协作。适合作为 Grok 线编程主力。

带搜索的调研

用于需要网页或 X 检索补充的知识工作。重点在把来源与结论分开写清。

代码执行核对

用于边写边跑、用执行结果校正结论的短中程任务。

和 Grok 4.3、GPT-5.6 Sol 怎么选

三款都是当代主力。差别主要在上下文长度、产品栈,以及 Agent 取向。

对比项Grok 4.5Grok 4.3GPT-5.6 Sol
上下文500K tokens1M tokens1M tokens
推理方式Agent 取向 · 更高效深度档位可调最大深度 · 可开 ultra
编程与 AgentxAI 旗舰编程与 Agent长文档与工具调用OpenAI 最重长程编程
长程工具协作工具与搜索可接长线程更宽裕旗舰深度 + ultra
速度取向更看重工具协作效率可降深度换速度更看重完成质量
更适合优先选用绑定 xAI 栈的编程与 Agent需要百万级上下文的 Grok 任务绑定 OpenAI 深度栈时

在 iMini 上使用 Grok 4.5

关于免费额度、型号选择、主要规格,以及和 4.3、Sol 怎么区分。

在 iMini Agent 免费使用 Grok 4.5

50 万级上下文,适合多步编程与检索、代码执行协作。

打开 Grok 4.5

无需 xAI API Key。