Anthropic · Claude Opus 5 · 2026 年 7 月

Claude Opus 5 — Anthropic 面向编程与智能体任务的最强模型

  • 百万级上下文
  • 超长单次输出
  • 自带深度思考
  • 深度档位可调
Claude Opus 5

Claude Opus 5 是什么?

Claude Opus 5 是 Anthropic 在 2026 年 7 月发布的 Opus 旗舰。它面向不能半途交卷的工作:大仓库里改功能、查根因、带着工具一步步把事情做完。自带深度思考,上下文与输出都按长任务来配;需要更深或更省时,再用深度档位调节。相对 Claude Opus 4.8,长程编程、多步工具和知识工作更稳,也更少留下半截补丁。在 iMini Agent 里选 Claude Opus 5 即可使用。

厂商
Anthropic
发布
2026 年 7 月
上下文
1M tokens
最大输出
128K tokens
深度思考
自带开启 · 可调
适合作为
长程编程与 Agent 主力

相对 Claude Opus 4.8,升级了什么

开箱行为、长程完成度、上下文与多步工具——这四点是当作日常主力前最该看清的变化。

深度思考开箱即开

自带深度思考,先整理约束与路径再动手;需要更深或更快时,再调深度档位。复杂任务更少「上来就写、写完才发现问题」。

长程编程完成度更高

跨文件功能、大型重构与根因排查时,更少交出未完成改动,也更少只处理表面症状,更适合作为日常工程主力。

长上下文下更稳地推进

长规格、多轮历史与工具轨迹可以留在同一条对话里持续推进。大仓库改造与长迁移计划不必过早拆成碎片会话。

多步工具工作流更完整

连续调用工具、端到端跑完的任务里,对目标与中止条件的保持更好,中途跑偏或做到一半停住的情况更少,更适合作为 Agent 主力。

官方评测与对齐审计

Anthropic 随 Claude Opus 5 一并公布的评测与对齐结果,覆盖软件工程、知识工作、业务自动化与行为审计。

Claude Opus 5 多任务评测总览
多任务总览。把软件工程、知识工作、业务自动化、电脑使用等评测放在同一张表里对照,可以看到 Claude Opus 5 相对 Claude Opus 4.8、Claude Fable 5 等同代模型的整体位置,而不是只看单一分数。
Frontier-Bench:Agent 编程表现随深度档位变化
Frontier-Bench 关注 Agent 编程能力。图中展示不同深度档位下的表现变化:Claude Opus 5 明显强于 Claude Opus 4.8,也是判断它能否承担长程编程、终端与工具协作任务的核心依据之一。
CursorBench:IDE 编程表现随深度档位变化
CursorBench 更贴近 IDE 里的日常编程与 Agent 协作。图中展示不同深度档位下的表现;最高档位接近 Claude Fable 5,适合编辑器内改仓库、做多步修改时对照。
GDPval-AA:知识工作表现随深度档位变化
GDPval-AA 衡量真实知识工作表现,曲线随深度档位上升。覆盖调研整理、表格处理与数值推理等任务,用来观察 Claude Opus 5 在长材料与硬约束下能否稳定给出可核对的结论。
AutomationBench:端到端业务任务通过率
AutomationBench 衡量端到端业务工作流能否从头跑完。Claude Opus 5 通过率处在前列;即便使用较低深度档位,仍能保持较高完成水平,是多步业务 Agent 的重要参考。
ARC-AGI-3:新颖问题求解表现
ARC-AGI-3 考察少见约束与新颖问题下的求解能力。Claude Opus 5 显著高于同屏对照模型,说明它在缺少现成模板时,仍能把问题拆开并持续推演到可解。
行为对齐审计:不对齐分数
行为对齐审计统计欺骗、被诱使滥用等不对齐行为,分数越低越好。Claude Opus 5 为 2.3,低于近期同系列对照模型,是把它放进生产主力时,除能力分数以外同样需要看的一项结果。
OSS-Fuzz:漏洞发现与利用生成
OSS-Fuzz 把「发现漏洞」和「写出可利用攻击」分开衡量。Claude Opus 5 在发现能力上接近 Mythos 5,但在利用生成上明显更弱;安全相关流程里,这两项不能混为一谈。

三种常见用法

Claude Opus 5 更适合承担需要持续推进、并最终给出可交付结果的工作。

仓库改造与代码评审

用于跨文件改功能、难复现缺陷排查,以及对 PR 做有依据的评审。重点不在快速给出意见,而在把根因、影响面和验证方式写清楚,减少合入后再次返工。

调研整理与决策备忘

用于把长材料收成一页可决策的结论:问题是什么、有哪些选项、推荐哪一个、风险在哪里。适合带表格、数字和明确约束的知识工作。

多步 Agent 任务

用于需要连续调用工具、分步推进到结果的工作流。适合事先约定每一步的输入、完成标准和停止条件,让任务能够从头跑到尾。

和 Claude Fable 5、GPT-5.6 Sol 怎么选

三款都是当代旗舰。差别主要在开箱深度、产品栈,以及你更常跑哪类任务。

对比项Claude Opus 5Claude Fable 5GPT-5.6 Sol
上下文1M tokensClaude 顶档长上下文OpenAI Sol 旗舰上下文
推理方式自带深度思考,可调Claude 系列最顶能力档OpenAI 最大深度档
编程与 Agent长程编程与多步 Agent 的日常主力需要 Claude 线顶档能力时团队已绑定 OpenAI 深度栈时更合适
长程工具协作目标保持更好,完成度更高更重、更顶的 Agent 场景可在 iMini Agent 使用,栈偏向 OpenAI
速度取向更看重完成质量与稳定性更重、成本与时延通常更高以最大深度为主
更适合优先选用新增长程编程、多步 Agent、知识工作追求 Claude 线顶档能力,并能接受更高负载时组织标准已固定为 OpenAI Sol

在 iMini 上使用 Claude Opus 5

关于免费额度、型号选择、主要规格,以及和 Claude Fable 5、GPT-5.6 Sol 怎么区分。

在 iMini Agent 免费使用 Claude Opus 5

百万级上下文,自带深度思考,深度档位可调。

打开 Claude Opus 5

无需 Anthropic API Key。