WayToClawEarn
高影响官方发布

OpenAI 发布 GPT-5.5:82.7% Terminal-Bench 刷新 SOTA,Agent 编程能力大幅跃升

OpenAI 于 2026 年 4 月 23 日发布 GPT-5.5,在 Terminal-Bench 2.0 上达到 82.7% 的 SOTA 准确率,定价 $5/百万输入 tokens,已开始向 Plus/Pro 用户推送。

WayToClawEarn Editorial发布 2026年4月24日更新 2026年8月8日

编辑基于公开来源复核 · AI 辅助整理。 内容方法 · 原始来源

OpenAI 发布 GPT-5.5:82.7% Terminal-Bench 刷新 SOTA,Agent 编程能力大幅跃升

核心结论

OpenAI 于 2026 年 4 月 23 日发布 GPT-5.5,宣称其为"最智能且最易用"的模型。新模型在 Terminal-Bench 2.0 上达到 82.7% 的 SOTA 准确率,在 Expert-SWE 内部评测中达到 73.1%,同时在保持与 GPT-5.4 相同的推理延迟下显著降低 token 消耗。模型已开始在 ChatGPT 和 Codex 中向 Plus/Pro/Business/Enterprise 用户逐步推送,API 价格定为 $5/百万输入 tokens、$30/百万输出 tokens。


背景与触发事件

字段内容
时间2026-04-23
地点/渠道OpenAI 官方博客发布
主要参与者OpenAI、NVIDIA、Anthropic(竞品对比)

事件要点

  • GPT-5.5 是 GPT-5.4 的后继版本,重点提升 agentic coding、computer use 和知识工作能力
  • 与 GPT-5.4 相同延迟但更智能、更 token 高效
  • 通过 Codex 分析数周生产流量模式,编写自定义启发式算法优化 GPU 负载均衡,token 生成速度提升 20%+
  • 基于 NVIDIA GB200/GB300 NVL72 系统训练和推理
  • 系统卡已发布,生物/化学和网络安全能力被评估为 High(非 Critical)

关键影响

技术影响表

维度影响内容
Agent 编程Terminal-Bench 2.0 82.7%(+7.6pp vs GPT-5.4)、SWE-Bench Pro 58.6%(+0.9pp)、Expert-SWE 73.1%(+4.6pp)
知识工作GDPval 84.9%(胜率)、OSWorld-Verified 78.7%、Tau2-bench Telecom 98.0%
科学研究GeneBench 25.0%(+6pp)、BixBench 80.5%(+6.5pp)、FrontierMath Tier 1-3 51.7%(+4.1pp)
长上下文1M token 上下文窗口,MRCR 8-needle 512K-1M 达 74.0%(vs GPT-5.4 36.6%)
抽象推理ARC-AGI-2 Verified 85.0%(+11.7pp vs GPT-5.4)

行业影响表

方面可能变化
竞争格局定价介于 GPT-5.4 和 Claude Opus 4.7 之间,输出定价高 20% 但 token 效率更高
代码助手市场Codex 用户将在数小时内逐步获得 GPT-5.5 支持,400K 上下文窗口
开发者工作流测试者称"首个具有严肃概念清晰度的编程模型",对大型代码库理解显著提升
AI 安全推出更严格网络安全分类器,扩展 Trusted Access for Cyber 项目

适配建议

对开发者

  • GPT-5.5 在 Codex 中可通过 Fast 模式以 1.5x 速度生成 tokens(成本 2.5x)
  • API 定价 $5/百万输入、$30/百万输出,Batch/Flex 半价,Priority 2.5x
  • GPT-5.5 Pro API 定价 $30/百万输入、$180/百万输出,面向更高精度需求

对使用者

  • ChatGPT 中 GPT-5.5 Thinking 已向 Plus/Pro 用户开放
  • GPT-5.5 Pro 仅限 Pro/Business/Enterprise 用户使用

值得关注的点

  • OpenAI 正在构建"agentic AI 的全球基础设施"
  • GPT-5.5 被用于改进自身推理基础设施——模型帮助改善服务它的系统,形成正循环
  • 数学发现能力:GPT-5.5 协助发现拉姆齐数新证明,后经 Lean 验证,是其参与核心数学研究的首例公开实例

工具词条

本次发布涉及多个 AI 生态工具:

  • OpenAI — GPT-5.5 的发布方,模型通过 ChatGPT 和 Codex 提供
  • Anthropic — Claude Opus 4.7 在多项 benchmark 中被列为对比对象
  • NVIDIA — 提供 GB200/GB300 NVL72 系统支撑 GPT-5.5 的训练和推理
  • Codex — OpenAI 的 AI 编程代理,GPT-5.5 在 Codex 中展现最强的 agentic 编程能力
  • n8n — 工作流自动化工具,与 AI agent 生态密切相关

行业反应

  • Dan Shipper(Every 创始人兼CEO):"首个具有严肃概念清晰度的编程模型。"
  • Justin Boitano(NVIDIA 企业AI 副总裁):"GPT-5.5 提供了执行密集型工作所需的持续性能……让团队能够从自然语言提示到端到端功能发布。"
  • Brandon White(Axiom Bio 联合创始人兼CEO):"如果 OpenAI 继续这样发展,到年底药物发现的基础将发生改变。"
  • HN 社区:GPT-5.5 以 1416 点登顶 HN 首页。开发者关注其 Terminal-Bench 82.7% 的大幅领先(Claude Opus 4.7 为 69.4%),但对 SWE-Bench Pro 上仍落后 Claude Opus 4.7(64.3% vs 58.6%)表示关注。多位用户注意到 ARC-AGI-3 分数未被公布。

行动引导

想了解更多实际应用?请查看:

  • 教程:如何在 Codex 中配置 GPT-5.5 进行高效编程
  • 案例:使用 GPT-5.5 自动化和优化开发工作流的真实案例

OpenAIGPT-5.5AI模型Agent编程大模型

查看原文 →

免责声明:本站案例均为知识分享内容,仅供灵感与参考,不构成收益承诺;由此进行的外部执行与结果请自行判断并承担相应责任。