智谱 · GLM 5.1 · 2026 年 4 月

GLM 5.1 — 面向数小时级持续任务的编程模型

  • 约 200K 上下文
  • 超长单次输出
  • 适合长时间推进
  • 开源权重可对照
GLM 5.1

GLM 5.1 是什么?

GLM 5.1 是智谱在 2026 年 4 月发布的型号,官方强调可连续推进数小时的编程与终端工具任务,中途少停住。相对 GLM-5,在 SWE 与终端评测上显著抬升。需要百万级上下文时,优先评估 GLM 5.2。在 iMini Agent 里选 GLM 5.1 即可使用。

厂商
智谱
发布
2026 年 4 月
上下文
约 200K tokens
最大输出
128K tokens
深度思考
适合长时间推进
更适合
已验证的长时间编程工作流

相对 GLM-5,升级了什么

可持续推进时长与工程评测——继续用 5.1 前最该看清的能力。

可持续推进更久

官方称单任务最长约数小时连续工作,适合仓库级改造,中途少停住。

工程评测抬升

在 SWE-Bench Pro、Terminal-Bench 等官方主推评测上相对前代更强。

开源与工具链兼容

开放权重,并兼容常见编码工具链,便于迁移评估。

仍可稳定沿用

工作流已在 5.1 验证时不必强迁;新开百万级任务再看 5.2。

官方评测

智谱公布的 GLM-5.1 编程评测,综合 SWE-Bench Pro、Terminal-Bench 2.0 与 NL2Repo。

GLM-5.1 编程综合评测对照
编程综合分 54.9,高于 Gemini 3.1 Pro、Qwen3.6-Plus、MiniMax M2.7 与 Kimi K2.5,低于 GPT-5.4(58.0)与 Claude Opus 4.6(57.5)。三项基准合并后的位置一目了然。

三种常见用法

GLM 5.1 仍适合已验证的长时间编程与终端工具工作流。

长时间编程

用于长时间重构与修复。需要百万级上下文时可对照 5.2。

终端工具任务

用于命令行多步任务。重点在成功标准。

双语工程协作

用于中英混合的规格与代码评审。

和 GLM 5.2、Qwen3.6 Plus 怎么选

三款都偏中文工程场景。差别主要在上下文长度与代际能力。

对比项GLM 5.1GLM 5.2Qwen3.6 Plus
上下文约 200K1M tokens1M tokens
推理方式适合长时间推进High / Max 可调编码与工具取向
编程与工具长时间编程与终端任务百万上下文长任务编程多模态仓库级编程
长程工具协作可持续推进数小时长线程交付内置工具 + 视频
速度取向长跑更重可调思考预算工作流取向
更适合优先选用工作流仍锁在 5.1 时需要百万级上下文时绑定通义多模态时

在 iMini 上使用 GLM 5.1

关于免费额度、型号选择、主要规格,以及和 5.2 怎么区分。

在 iMini Agent 免费使用 GLM 5.1

适合可持续推进数小时的编程与终端工具任务。

打开 GLM 5.1

无需智谱 API Key。