Anthropic · Claude Opus 4.8 · 2026 年 5 月

Claude Opus 4.8 — 编程与工具调用可靠性全面提升

  • 百万级上下文
  • 超长单次输出
  • 通常高深度
  • 对齐与诚实度更高
Claude Opus 4.8

Claude Opus 4.8 是什么?

Claude Opus 4.8 是 Anthropic 在 2026 年 5 月发布的 Opus,相对 Claude Opus 4.7 在协作判断、Agent 可靠性与诚实度上可感知升级。通常以较高深度工作;更难任务可再加深。新增长程编程与知识工作更常选 Claude Opus 5;若工作流已在 4.8 验证,或需要稳定的 Opus 回退能力,仍可继续使用。在 iMini Agent 里选 Claude Opus 4.8 即可使用。

厂商
Anthropic
发布
2026 年 5 月
上下文
1M tokens
最大输出
128K tokens
深度思考
通常高深度 · 可调
适合作为
已验证 Opus 工作流主力

相对 Claude Opus 4.7,升级了什么

诚实度、Agent 判断,以及电脑使用——从 4.7 迁到 4.8 前最该看清的变化。

更主动标注不确定

回答时更常说明不确定之处;自写代码里被忽略的缺陷显著减少,适合作为协作主力。

Agent 判断更可靠

工具调用与多步任务里更少多余步骤,完成同等智能任务时路径更干净。

电脑与浏览器 Agent 更强

在 Online-Mind2Web 等官方电脑使用评测上明显抬升,适合端到端网页与桌面流程。

对齐审计更好

欺骗与协助滥用等不对齐行为率相对 4.7 显著下降,接近当时 Mythos Preview 的安全水位。

官方评测与安全审计

Anthropic 随 Claude Opus 4.8 一并公布的评测结果,与 Claude Opus 4.7、GPT-5.5、Gemini 3.1 Pro 同屏对照,覆盖软件工程、多学科推理、电脑使用与行为对齐。

Claude Opus 4.8 与 Opus 4.7、GPT-5.5、Gemini 3.1 Pro 的多任务评测对照表
多任务总览。SWE-Bench Pro 69.2%、OSWorld-Verified 83.4%、GDPval-AA 1890、Finance Agent v2 53.9%,均高于 Claude Opus 4.7 与同屏对照模型;Terminal-Bench 2.1 为 74.6%,略低于 GPT-5.5 的 78.2%。
行为对齐审计:Claude Opus 4.8 不对齐行为分数
行为对齐审计统计欺骗、被诱使滥用等不对齐行为,分数越低越好。Claude Opus 4.8 为约 1.83,低于 Claude Opus 4.7 与 Claude Sonnet 4.6;生产部署时,这一项与能力分数同样需要看。

三种常见用法

Claude Opus 4.8 仍适合已验证的 Opus 档工作;新旗舰负载可对照 Opus 5。

代码协作与评审

用于功能开发、缺陷排查与有依据的 PR 评审。适合提示与评测已绑定在 4.8 上的团队。

电脑使用与浏览器流程

用于需要操作网页或桌面环境的多步任务。重点在把完成标准与中止条件写清楚。

专业领域 Agent

用于法律、金融等需要稳健判断的工作流。新开顶格长程任务可再评估 Opus 5 或 Fable 5。

和 Claude Opus 5、Claude Sonnet 5 怎么选

三款都是 Claude 主力。差别主要在代际上限、高频成本,以及工作流是否已验证。

对比项Claude Opus 4.8Claude Opus 5Claude Sonnet 5
上下文1M tokens1M tokens1M tokens
推理方式通常高深度,可调自带深度思考,可调深度档位可调
编程与 AgentOpus 编程与协作当前长程编程旗舰主力规模化 Agent 与日常编程
长程工具协作稳定 Opus 档协作目标保持更好,完成度更高高频主力更合适
速度取向质量与体验均衡更看重完成质量更看重吞吐
更适合优先选用工作流已在 4.8 验证通过时新增长程编程与知识工作新增高频 Agent 主力

在 iMini 上使用 Claude Opus 4.8

关于免费额度、型号选择、主要规格,以及和 Opus 5 怎么区分。

在 iMini Agent 免费使用 Claude Opus 4.8

百万级上下文,通常高深度,适合已验证的 Opus 工作流。

打开 Claude Opus 4.8

无需 Anthropic API Key。