OpenAI · GPT-5.5 · 2026 年 4 月

GPT-5.5 — 兼具编程、分析与工具调用能力的通用旗舰

  • 百万级上下文
  • 超长单次输出
  • 深度档位可调
  • Agent 编程主力代
GPT-5.5

GPT-5.5 是什么?

GPT-5.5 是 OpenAI 在 2026 年 4 月发布的旗舰,面向复杂专业工作:Agent 编程、电脑使用、知识工作与早期科研。相对 GPT-5.4,官方强调更强的 Agent 能力与更少的 token 消耗。进入 GPT-5.6 后,最重任务可对照 Sol,日常均衡可对照 Terra;若工作流已稳定跑在 GPT-5.5,仍可继续作为主力。在 iMini Agent 里选 GPT-5.5 即可使用。

厂商
OpenAI
发布
2026 年 4 月
上下文
1M tokens
最大输出
128K tokens
深度推理
档位可调
适合作为
已验证工作流的旗舰主力

相对 GPT-5.4,升级了什么

Agent 编程、同延迟下的智能,以及知识工作——从 5.4 迁到 5.5 前最该看清的变化。

Agent 编程更强

官方在 Terminal-Bench 等 Agent 编程评测上给出更高完成度,更适合多步编程与工具协作。

同延迟下更高智能

相对 GPT-5.4,官方强调在相近服务延迟下提供更强智能,并在 Codex 类任务上用更少 token 完成工作。

长上下文专业工作更稳

百万级上下文支持把长规格、多源材料与工具轨迹放在同一条线程里推进,适合知识工作与复杂交付。

科研与安全评测阶梯抬升

在 GeneBench、网络安全相关评测上,官方报告相对前代有阶梯式提升,适合对照后再决定是否迁到 GPT-5.6。

官方评测

OpenAI 随 GPT-5.5 发布公布的评测结果,对照 GPT-5.4 与同代旗舰,覆盖综合智能、软件工程、知识工作、电脑操作与安全研究。

Artificial Analysis Intelligence Index:综合智能对比
第三方综合智能指数,横轴为输出 token 总量。GPT-5.5 全程在 GPT-5.4、Claude Opus 4.7 之上,且到达同等分数所需的输出更少——升级的同时任务完成得更省。
Terminal-Bench 2.0:命令行软件工程任务
Terminal-Bench 2.0 测命令行里的真实软件工程流程。GPT-5.5 峰值约 83%,明显高于 GPT-5.4,且在低输出档位就能到 75% 以上,多步终端任务不必开满深度也够稳。
Expert-SWE:专家级软件工程任务
Expert-SWE 由资深工程师出题,衡量专家级软件工程能力。GPT-5.5 峰值约 73%,同等输出下比 GPT-5.4 高约 5 个百分点,大型编程任务的返工率更低。
GDPval:与行业专家对比的知识工作胜率
GDPval 把模型产出和行业专家的成品盲评对比。GPT-5.5 胜+平合计 84.9%,高于 GPT-5.4(83.0%)和 Claude Opus 4.7(80.3%),写报告、做表格这类专业产出已在专家基线之上。
OSWorld-Verified:图形界面电脑操作
OSWorld-Verified 测在真实图形界面里完成任务。GPT-5.5 用更少的工具调用轮次拿到接近 80% 的成绩,电脑操作类 Agent 跑得更快也更省。
Tau2-bench Telecom:多轮工具调用客服流程
Tau2-bench Telecom 模拟带工具调用的多轮业务流程。GPT-5.5 准确率接近 98%,且只用了 GPT-5.4 三分之一的输出量,是把它接进业务自动化的直接依据。
GeneBench:生物科学推理
GeneBench 测长时程生物科学推理。GPT-5.5 到 25%,比 GPT-5.4 的 19% 高出一截,且所需输出更少,科研类长推理任务收益明显。
Capture-the-Flags:安全攻防挑战任务
CTF 挑战测端到端安全研究能力。GPT-5.5 用约 5 万输出 token 达到 88%,GPT-5.4 需要近 14 万才到 84%——这也是 OpenAI 对它启用最强安全防护的原因之一。

三种常见用法

GPT-5.5 仍适合承担已验证的复杂专业工作;新开的最重负载可对照 GPT-5.6。

Agent 编程与仓库改造

用于多步编程、测试修复与跨文件功能。适合已有提示与评测集绑定在 GPT-5.5 上的团队继续沿用。

知识工作与决策备忘

用于调研整理、表格处理与一页决策备忘。重点在引用硬约束并给出可核对的推荐。

工具与电脑使用流程

用于需要连续调用工具、端到端跑完的工作流。适合事先约定成功标准与中止条件。

和 GPT-5.6 Sol、GPT-5.6 Terra 怎么选

三款都属 OpenAI 主力。差别主要在代际深度、日常成本,以及工作流是否已验证。

对比项GPT-5.5GPT-5.6 SolGPT-5.6 Terra
上下文1M tokens1M tokens1M tokens
推理方式深度档位可调最大深度 · 可开 ultra均衡深度
编程与 Agent旗舰编程与 Agent当代最重长程编程日常编程与中等 Agent
长程工具协作已验证工作流可继续旗舰深度 + ultra完成度与吞吐更均衡
速度取向专业工作主力更看重完成质量与深度日常主力更均衡
更适合优先选用工作流已在 5.5 验证通过时新开的最重推理与长程任务想贴近 5.5 能力、又走 5.6 均衡档时

在 iMini 上使用 GPT-5.5

关于免费额度、型号选择、主要规格,以及和 GPT-5.6 怎么区分。

在 iMini Agent 免费使用 GPT-5.5

百万级上下文,深度档位可调,适合已验证的专业工作流。

打开 GPT-5.5

无需 OpenAI API Key。