WayToClawEarn
高影响OpenAI 官方发布;Orply 二次解析

OpenAI Agents API 公测:把 Codex 运行层交给开发者,先看权限和执行边界

OpenAI 已将 Agents API 进入公开测试,把 Codex harness、托管沙箱、上下文管理、工具编排和多 Agent 并行能力提供给开发者;本文区分平台接管的运行层与应用方必须负责的权限、数据和生产操作。

WayToClawEarn Editorial发布 2026年9月11日

编辑基于公开来源复核 · AI 辅助整理。 内容方法 · 原始来源

OpenAI Agents API 公测:把 Codex 的运行层交给开发者,先看权限和执行边界

OpenAI 于 2026 年 9 月 10 日宣布 Agents API 进入公开测试。它解决的不是“再调用一次大模型”,而是把长期运行 Agent 所需的会话、上下文管理、工具编排、子 Agent 并行和执行环境,收进一个由 OpenAI 托管的 Codex harness。

已确认的发布事实

  • Agents API 已进入 public beta,开发者可以通过一次 API 调用指定任务、模型、工具和执行环境,创建云端 Agent。
  • OpenAI 负责维护 harness;执行环境可以选择 OpenAI 托管沙箱、自有基础设施,或合作方环境。官方列出的合作方包括 Cloudflare、Daytona、E2B、Modal、Oracle、Runloop 和 Vercel 等。
  • OpenAI 同时推出 hosted sandbox,可让 Agent 运行代码、处理文件并产出 artifacts;沙箱可配置文件、包、skills 和 plugins。
  • 官方示例展示了 MCP、内置工具、tool search、programmatic tool calling 和多 Agent 并行能力;示例中的多 Agent 配置最多并行 3 个子 Agent。
  • Agents API 的公开测试阶段不额外收取 API 使用费,开发者仍需为 Agent 使用的模型 token 和工具付费。公开测试会继续迭代,不能当作稳定版 SLA。

它改变了什么

传统 Agent 产品往往要自己维护队列、重试、上下文压缩、工具注册、沙箱和多 Agent 调度。Agents API 把其中一部分基础设施交给 OpenAI,开发者可以把精力放在三件事上:定义任务、控制工具与数据访问、设计人类审批边界。

但这不等于“Agent 可以自动接管生产系统”。官方和二次报道都强调,应用方仍然负责工具、权限、知识、运行手册和执行环境。能力越强,权限配置越是产品本身的一部分。

对开发者最重要的四个判断

1. 先选执行环境,再谈模型效果

OpenAI 托管沙箱适合快速验证;自有基础设施或 VPC 环境更适合需要内部网络、合规隔离和既有凭据体系的工作流。切换环境会改变冷启动、存储、网络、成本和运维责任,不能只比较模型回答质量。

2. 长会话要验证“压缩后还能不能继续做对

Agents API 会在接近上下文限制时自动压缩较早内容,也提供 tool search 和 programmatic tool calling 来减少无关工具结果进入上下文。上线前应准备跨多个上下文窗口的回放任务,检查关键约束、证据链接和未完成动作是否被保留。

3. 并行子 Agent 不等于并行写生产

多 Agent 适合拆分调查、检索、代码审查等相互独立的工作;共享写操作、支付、发布、权限变更仍应通过统一审批和幂等控制。Orply 对官方演示的二次解析也把“证据报告和人工交接”作为示例结论,而不是自动执行修复。

4. 不要把公开测试的费用结构当成总成本

官方表示 Agents API 本身不额外收费,但模型 token、内置或自定义工具、沙箱、存储、网络和第三方基础设施仍会产生费用。真实单位成本必须按“完成一次任务”核算,而不是只看 API 是否收平台费。

适合第一批验证的任务

  • 只读的故障调查:读取监控和日志,输出带证据的排查报告,不直接执行回滚。
  • 研究与资料整理:并行检索不同来源,统一生成引用和待核实清单。
  • 代码审查:在隔离环境中运行测试并提交建议,合并仍由人审批。
  • 内容运营:采集热点、去重、生成草稿和证据记录,发布动作继续通过质量门禁。

接入前最小清单

  1. 列出 Agent 可以读取、写入和执行的每一个工具,并为高风险动作设置人工确认。
  2. 把生产、预发布和本地证据分开,给每个任务写清时间范围、时区和数据来源。
  3. 设计失败恢复:超时、重复工具调用、上下文压缩、沙箱重启和部分结果返回都要可回放。
  4. 对并行任务设置幂等键、最大并发、预算和停止条件。
  5. 用一组固定任务比较自建 harness 与 Agents API 的完成率、延迟、人工介入率和单任务成本;不要把厂商客户引述当成自己的实测。

证据边界

Agents API 的公开测试、功能范围、执行环境选项和费用规则来自 OpenAI 官方发布。官方页面中的客户评价属于 OpenAI 发布的第三方引述,本文没有将其当作独立验证。Orply 的报道包含一个虚构的故障调查示例,文中示例数字和结论不能当作真实生产事故或我们的测试结果。

来源

OpenAIAgents APICodexAI agentshosted sandbox

查看原文 →

免责声明:本站案例均为知识分享内容,仅供灵感与参考,不构成收益承诺;由此进行的外部执行与结果请自行判断并承担相应责任。