OpenAI · GPT-5.5 · 2026 年 4 月

GPT-5.5 — 兼具編程、分析與工具呼叫能力的通用旗艦

  • 百萬級上下文
  • 超長單次輸出
  • 深度檔位可調
  • Agent 編程主力代
GPT-5.5

GPT-5.5 是什麼?

GPT-5.5 是 OpenAI 在 2026 年 4 月釋出的旗艦,面向複雜專業工作:Agent 編程、電腦使用、知識工作與早期科研。相對 GPT-5.4,官方強調更強的 Agent 能力與更少的 token 消耗。進入 GPT-5.6 後,最重任務可對照 Sol,日常均衡可對照 Terra;若工作流已穩定跑在 GPT-5.5,仍可繼續作為主力。在 iMini Agent 裡選 GPT-5.5 即可使用。

廠商
OpenAI
釋出
2026 年 4 月
上下文
1M tokens
最大輸出
128K tokens
深度推理
檔位可調
適合作為
已驗證工作流的旗艦主力

相對 GPT-5.4,升級了什麼

Agent 編程、同延遲下的智慧,以及知識工作——從 5.4 遷到 5.5 前最該看清的變化。

Agent 編程更強

官方在 Terminal-Bench 等 Agent 編程評測上給出更高完成度,更適合多步編程與工具協作。

同延遲下更高智慧

相對 GPT-5.4,官方強調在相近服務延遲下提供更強智慧,並在 Codex 類任務上用更少 token 完成工作。

長上下文專業工作更穩

百萬級上下文支援把長規格、多源材料與工具軌跡放在同一條執行緒裡推進,適合知識工作與複雜交付。

科研與安全評測階梯抬升

在 GeneBench、網路安全相關評測上,官方報告相對前代有階梯式提升,適合對照後再決定是否遷到 GPT-5.6。

官方評測

OpenAI 隨 GPT-5.5 釋出公佈的評測結果,對照 GPT-5.4 與同代旗艦,覆蓋綜合智慧、軟體工程、知識工作、電腦操作與安全研究。

Artificial Analysis Intelligence Index:綜合智慧對比
第三方綜合智慧指數,橫軸為輸出 token 總量。GPT-5.5 全程在 GPT-5.4、Claude Opus 4.7 之上,且到達同等分數所需的輸出更少——升級的同時任務完成得更省。
Terminal-Bench 2.0:命令列軟體工程任務
Terminal-Bench 2.0 測命令列裡的真實軟體工程流程。GPT-5.5 峰值約 83%,明顯高於 GPT-5.4,且在低輸出檔位就能到 75% 以上,多步終端任務不必開滿深度也夠穩。
Expert-SWE:專家級軟體工程任務
Expert-SWE 由資深工程師出題,衡量專家級軟體工程能力。GPT-5.5 峰值約 73%,同等輸出下比 GPT-5.4 高約 5 個百分點,大型編程任務的返工率更低。
GDPval:與行業專家對比的知識工作勝率
GDPval 把模型產出和行業專家的成品盲評對比。GPT-5.5 勝+平合計 84.9%,高於 GPT-5.4(83.0%)和 Claude Opus 4.7(80.3%),寫報告、做表格這類專業產出已在專家基線之上。
OSWorld-Verified:圖形介面電腦操作
OSWorld-Verified 測在真實圖形介面裡完成任務。GPT-5.5 用更少的工具呼叫輪次拿到接近 80% 的成績,電腦操作類 Agent 跑得更快也更省。
Tau2-bench Telecom:多輪工具呼叫客服流程
Tau2-bench Telecom 模擬帶工具呼叫的多輪業務流程。GPT-5.5 準確率接近 98%,且只用了 GPT-5.4 三分之一的輸出量,是把它接進業務自動化的直接依據。
GeneBench:生物科學推理
GeneBench 測長時程生物科學推理。GPT-5.5 到 25%,比 GPT-5.4 的 19% 高出一截,且所需輸出更少,科研類長推理任務收益明顯。
Capture-the-Flags:安全攻防挑戰任務
CTF 挑戰測端到端安全研究能力。GPT-5.5 用約 5 萬輸出 token 達到 88%,GPT-5.4 需要近 14 萬才到 84%——這也是 OpenAI 對它啟用最強安全防護的原因之一。

三種常見用法

GPT-5.5 仍適合承擔已驗證的複雜專業工作;新開的最重負載可對照 GPT-5.6。

Agent 編程與倉庫改造

用於多步編程、測試修復與跨檔案功能。適合已有提示與評測集繫結在 GPT-5.5 上的團隊繼續沿用。

知識工作與決策備忘

用於調研整理、表格處理與一頁決策備忘。重點在引用硬約束並給出可核對的推薦。

工具與電腦使用流程

用於需要連續呼叫工具、端到端跑完的工作流。適合事先約定成功標準與中止條件。

和 GPT-5.6 Sol、GPT-5.6 Terra 怎麼選

三款都屬 OpenAI 主力。差別主要在代際深度、日常成本,以及工作流是否已驗證。

對比項GPT-5.5GPT-5.6 SolGPT-5.6 Terra
上下文1M tokens1M tokens1M tokens
推理方式深度檔位可調最大深度 · 可開 ultra均衡深度
編程與 Agent旗艦編程與 Agent當代最重長程編程日常編程與中等 Agent
長程工具協作已驗證工作流可繼續旗艦深度 + ultra完成度與吞吐更均衡
速度取向專業工作主力更看重完成質量與深度日常主力更均衡
更適合優先選用工作流已在 5.5 驗證通過時新開的最重推理與長程任務想貼近 5.5 能力、又走 5.6 均衡檔時

在 iMini 上使用 GPT-5.5

關於免費額度、型號選擇、主要規格,以及和 GPT-5.6 怎麼區分。

在 iMini Agent 免費使用 GPT-5.5

百萬級上下文,深度檔位可調,適合已驗證的專業工作流。

開啟 GPT-5.5

無需 OpenAI API Key。