Anthropic · Claude Opus 4.8 · 2026 年 5 月

Claude Opus 4.8 — 編程與工具呼叫可靠性全面提升

  • 百萬級上下文
  • 超長單次輸出
  • 通常高深度
  • 對齊與誠實度更高
Claude Opus 4.8

Claude Opus 4.8 是什麼?

Claude Opus 4.8 是 Anthropic 在 2026 年 5 月釋出的 Opus,相對 Claude Opus 4.7 在協作判斷、Agent 可靠性與誠實度上可感知升級。通常以較高深度工作;更難任務可再加深。新增長程編程與知識工作更常選 Claude Opus 5;若工作流已在 4.8 驗證,或需要穩定的 Opus 回退能力,仍可繼續使用。在 iMini Agent 裡選 Claude Opus 4.8 即可使用。

廠商
Anthropic
釋出
2026 年 5 月
上下文
1M tokens
最大輸出
128K tokens
深度思考
通常高深度 · 可調
適合作為
已驗證 Opus 工作流主力

相對 Claude Opus 4.7,升級了什麼

誠實度、Agent 判斷,以及電腦使用——從 4.7 遷到 4.8 前最該看清的變化。

更主動標註不確定

回答時更常說明不確定之處;自寫程式碼裡被忽略的缺陷顯著減少,適合作為協作主力。

Agent 判斷更可靠

工具呼叫與多步任務裡更少多餘步驟,完成同等智慧任務時路徑更乾淨。

電腦與瀏覽器 Agent 更強

在 Online-Mind2Web 等官方電腦使用評測上明顯抬升,適合端到端網頁與桌面流程。

對齊審計更好

欺騙與協助濫用等不對齊行為率相對 4.7 顯著下降,接近當時 Mythos Preview 的安全水位。

官方評測與安全審計

Anthropic 隨 Claude Opus 4.8 一併公佈的評測結果,與 Claude Opus 4.7、GPT-5.5、Gemini 3.1 Pro 同屏對照,覆蓋軟體工程、多學科推理、電腦使用與行為對齊。

Claude Opus 4.8 與 Opus 4.7、GPT-5.5、Gemini 3.1 Pro 的多工評測對照表
多工總覽。SWE-Bench Pro 69.2%、OSWorld-Verified 83.4%、GDPval-AA 1890、Finance Agent v2 53.9%,均高於 Claude Opus 4.7 與同屏對照模型;Terminal-Bench 2.1 為 74.6%,略低於 GPT-5.5 的 78.2%。
行為對齊審計:Claude Opus 4.8 不對齊行為分數
行為對齊審計統計欺騙、被誘使濫用等不對齊行為,分數越低越好。Claude Opus 4.8 為約 1.83,低於 Claude Opus 4.7 與 Claude Sonnet 4.6;生產部署時,這一項與能力分數同樣需要看。

三種常見用法

Claude Opus 4.8 仍適合已驗證的 Opus 檔工作;新旗艦負載可對照 Opus 5。

程式碼協作與評審

用於功能開發、缺陷排查與有依據的 PR 評審。適合提示與評測已繫結在 4.8 上的團隊。

電腦使用與瀏覽器流程

用於需要操作網頁或桌面環境的多步任務。重點在把完成標準與中止條件寫清楚。

專業領域 Agent

用於法律、金融等需要穩健判斷的工作流。新開頂格長程任務可再評估 Opus 5 或 Fable 5。

和 Claude Opus 5、Claude Sonnet 5 怎麼選

三款都是 Claude 主力。差別主要在代際上限、高頻成本,以及工作流是否已驗證。

對比項Claude Opus 4.8Claude Opus 5Claude Sonnet 5
上下文1M tokens1M tokens1M tokens
推理方式通常高深度,可調自帶深度思考,可調深度檔位可調
編程與 AgentOpus 編程與協作當前長程編程旗艦主力規模化 Agent 與日常編程
長程工具協作穩定 Opus 檔協作目標保持更好,完成度更高高頻主力更合適
速度取向質量與體驗均衡更看重完成質量更看重吞吐
更適合優先選用工作流已在 4.8 驗證通過時新增長程編程與知識工作新增高頻 Agent 主力

在 iMini 上使用 Claude Opus 4.8

關於免費額度、型號選擇、主要規格,以及和 Opus 5 怎麼區分。

在 iMini Agent 免費使用 Claude Opus 4.8

百萬級上下文,通常高深度,適合已驗證的 Opus 工作流。

開啟 Claude Opus 4.8

無需 Anthropic API Key。