Anthropic · Claude Opus 5 · 2026 年 7 月

Claude Opus 5 — Anthropic 面向編程與智能體任務的最強模型

  • 百萬級上下文
  • 超長單次輸出
  • 自帶深度思考
  • 深度檔位可調
Claude Opus 5

Claude Opus 5 是什麼?

Claude Opus 5 是 Anthropic 在 2026 年 7 月釋出的 Opus 旗艦。它面向不能半途交卷的工作:大倉庫裡改功能、查根因、帶著工具一步步把事情做完。自帶深度思考,上下文與輸出都按長任務來配;需要更深或更省時,再用深度檔位調節。相對 Claude Opus 4.8,長程編程、多步工具和知識工作更穩,也更少留下半截補丁。在 iMini Agent 裡選 Claude Opus 5 即可使用。

廠商
Anthropic
釋出
2026 年 7 月
上下文
1M tokens
最大輸出
128K tokens
深度思考
自帶開啟 · 可調
適合作為
長程編程與 Agent 主力

相對 Claude Opus 4.8,升級了什麼

開箱行為、長程完成度、上下文與多步工具——這四點是當作日常主力前最該看清的變化。

深度思考開箱即開

自帶深度思考,先整理約束與路徑再動手;需要更深或更快時,再調深度檔位。複雜任務更少「上來就寫、寫完才發現問題」。

長程編程完成度更高

跨檔案功能、大型重構與根因排查時,更少交出未完成改動,也更少只處理表面症狀,更適合作為日常工程主力。

長上下文下更穩地推進

長規格、多輪歷史與工具軌跡可以留在同一條對話裡持續推進。大倉庫改造與長遷移計劃不必過早拆成碎片會話。

多步工具工作流更完整

連續呼叫工具、端到端跑完的任務裡,對目標與中止條件的保持更好,中途跑偏或做到一半停住的情況更少,更適合作為 Agent 主力。

官方評測與對齊審計

Anthropic 隨 Claude Opus 5 一併公佈的評測與對齊結果,覆蓋軟體工程、知識工作、業務自動化與行為審計。

Claude Opus 5 多工評測總覽
多工總覽。把軟體工程、知識工作、業務自動化、電腦使用等評測放在同一張表裡對照,可以看到 Claude Opus 5 相對 Claude Opus 4.8、Claude Fable 5 等同代模型的整體位置,而不是隻看單一分數。
Frontier-Bench:Agent 編程表現隨深度檔位變化
Frontier-Bench 關注 Agent 編程能力。圖中展示不同深度檔位下的表現變化:Claude Opus 5 明顯強於 Claude Opus 4.8,也是判斷它能否承擔長程編程、終端與工具協作任務的核心依據之一。
CursorBench:IDE 編程表現隨深度檔位變化
CursorBench 更貼近 IDE 裡的日常編程與 Agent 協作。圖中展示不同深度檔位下的表現;最高檔位接近 Claude Fable 5,適合編輯器內改倉庫、做多步修改時對照。
GDPval-AA:知識工作表現隨深度檔位變化
GDPval-AA 衡量真實知識工作表現,曲線隨深度檔位上升。覆蓋調研整理、表格處理與數值推理等任務,用來觀察 Claude Opus 5 在長材料與硬約束下能否穩定給出可核對的結論。
AutomationBench:端到端業務任務通過率
AutomationBench 衡量端到端業務工作流能否從頭跑完。Claude Opus 5 通過率處在前列;即便使用較低深度檔位,仍能保持較高完成水平,是多步業務 Agent 的重要參考。
ARC-AGI-3:新穎問題求解表現
ARC-AGI-3 考察少見約束與新穎問題下的求解能力。Claude Opus 5 顯著高於同屏對照模型,說明它在缺少現成模板時,仍能把問題拆開並持續推演到可解。
行為對齊審計:不對齊分數
行為對齊審計統計欺騙、被誘使濫用等不對齊行為,分數越低越好。Claude Opus 5 為 2.3,低於近期同系列對照模型,是把它放進生產主力時,除能力分數以外同樣需要看的一項結果。
OSS-Fuzz:漏洞發現與利用生成
OSS-Fuzz 把「發現漏洞」和「寫出可利用攻擊」分開衡量。Claude Opus 5 在發現能力上接近 Mythos 5,但在利用生成上明顯更弱;安全相關流程裡,這兩項不能混為一談。

三種常見用法

Claude Opus 5 更適合承擔需要持續推進、並最終給出可交付結果的工作。

倉庫改造與程式碼評審

用於跨檔案改功能、難復現缺陷排查,以及對 PR 做有依據的評審。重點不在快速給出意見,而在把根因、影響面和驗證方式寫清楚,減少合入後再次返工。

調研整理與決策備忘

用於把長材料收成一頁可決策的結論:問題是什麼、有哪些選項、推薦哪一個、風險在哪裡。適合帶表格、數字和明確約束的知識工作。

多步 Agent 任務

用於需要連續呼叫工具、分步推進到結果的工作流。適合事先約定每一步的輸入、完成標準和停止條件,讓任務能夠從頭跑到尾。

和 Claude Fable 5、GPT-5.6 Sol 怎麼選

三款都是當代旗艦。差別主要在開箱深度、產品棧,以及你更常跑哪類任務。

對比項Claude Opus 5Claude Fable 5GPT-5.6 Sol
上下文1M tokensClaude 頂檔長上下文OpenAI Sol 旗艦上下文
推理方式自帶深度思考,可調Claude 系列最頂能力檔OpenAI 最大深度檔
編程與 Agent長程編程與多步 Agent 的日常主力需要 Claude 線頂檔能力時團隊已繫結 OpenAI 深度棧時更合適
長程工具協作目標保持更好,完成度更高更重、更頂的 Agent 場景可在 iMini Agent 使用,棧偏向 OpenAI
速度取向更看重完成質量與穩定性更重、成本與時延通常更高以最大深度為主
更適合優先選用新增長程編程、多步 Agent、知識工作追求 Claude 線頂檔能力,並能接受更高負載時組織標準已固定為 OpenAI Sol

在 iMini 上使用 Claude Opus 5

關於免費額度、型號選擇、主要規格,以及和 Claude Fable 5、GPT-5.6 Sol 怎麼區分。

在 iMini Agent 免費使用 Claude Opus 5

百萬級上下文,自帶深度思考,深度檔位可調。

開啟 Claude Opus 5

無需 Anthropic API Key。