OpenAI Agents API 公测:把 Codex 运行层交给开发者,先看权限和执行边界
OpenAI 已将 Agents API 进入公开测试,把 Codex harness、托管沙箱、上下文管理、工具编排和多 Agent 并行能力提供给开发者;本文区分平台接管的运行层与应用方必须负责的权限、数据和生产操作。
OpenAI Agents API 公测:把 Codex 的运行层交给开发者,先看权限和执行边界
OpenAI 于 2026 年 9 月 10 日宣布 Agents API 进入公开测试。它解决的不是“再调用一次大模型”,而是把长期运行 Agent 所需的会话、上下文管理、工具编排、子 Agent 并行和执行环境,收进一个由 OpenAI 托管的 Codex harness。
已确认的发布事实
- Agents API 已进入 public beta,开发者可以通过一次 API 调用指定任务、模型、工具和执行环境,创建云端 Agent。
- OpenAI 负责维护 harness;执行环境可以选择 OpenAI 托管沙箱、自有基础设施,或合作方环境。官方列出的合作方包括 Cloudflare、Daytona、E2B、Modal、Oracle、Runloop 和 Vercel 等。
- OpenAI 同时推出 hosted sandbox,可让 Agent 运行代码、处理文件并产出 artifacts;沙箱可配置文件、包、skills 和 plugins。
- 官方示例展示了 MCP、内置工具、tool search、programmatic tool calling 和多 Agent 并行能力;示例中的多 Agent 配置最多并行 3 个子 Agent。
- Agents API 的公开测试阶段不额外收取 API 使用费,开发者仍需为 Agent 使用的模型 token 和工具付费。公开测试会继续迭代,不能当作稳定版 SLA。
它改变了什么
传统 Agent 产品往往要自己维护队列、重试、上下文压缩、工具注册、沙箱和多 Agent 调度。Agents API 把其中一部分基础设施交给 OpenAI,开发者可以把精力放在三件事上:定义任务、控制工具与数据访问、设计人类审批边界。
但这不等于“Agent 可以自动接管生产系统”。官方和二次报道都强调,应用方仍然负责工具、权限、知识、运行手册和执行环境。能力越强,权限配置越是产品本身的一部分。
对开发者最重要的四个判断
1. 先选执行环境,再谈模型效果
OpenAI 托管沙箱适合快速验证;自有基础设施或 VPC 环境更适合需要内部网络、合规隔离和既有凭据体系的工作流。切换环境会改变冷启动、存储、网络、成本和运维责任,不能只比较模型回答质量。
2. 长会话要验证“压缩后还能不能继续做对
Agents API 会在接近上下文限制时自动压缩较早内容,也提供 tool search 和 programmatic tool calling 来减少无关工具结果进入上下文。上线前应准备跨多个上下文窗口的回放任务,检查关键约束、证据链接和未完成动作是否被保留。
3. 并行子 Agent 不等于并行写生产
多 Agent 适合拆分调查、检索、代码审查等相互独立的工作;共享写操作、支付、发布、权限变更仍应通过统一审批和幂等控制。Orply 对官方演示的二次解析也把“证据报告和人工交接”作为示例结论,而不是自动执行修复。
4. 不要把公开测试的费用结构当成总成本
官方表示 Agents API 本身不额外收费,但模型 token、内置或自定义工具、沙箱、存储、网络和第三方基础设施仍会产生费用。真实单位成本必须按“完成一次任务”核算,而不是只看 API 是否收平台费。
适合第一批验证的任务
- 只读的故障调查:读取监控和日志,输出带证据的排查报告,不直接执行回滚。
- 研究与资料整理:并行检索不同来源,统一生成引用和待核实清单。
- 代码审查:在隔离环境中运行测试并提交建议,合并仍由人审批。
- 内容运营:采集热点、去重、生成草稿和证据记录,发布动作继续通过质量门禁。
接入前最小清单
- 列出 Agent 可以读取、写入和执行的每一个工具,并为高风险动作设置人工确认。
- 把生产、预发布和本地证据分开,给每个任务写清时间范围、时区和数据来源。
- 设计失败恢复:超时、重复工具调用、上下文压缩、沙箱重启和部分结果返回都要可回放。
- 对并行任务设置幂等键、最大并发、预算和停止条件。
- 用一组固定任务比较自建 harness 与 Agents API 的完成率、延迟、人工介入率和单任务成本;不要把厂商客户引述当成自己的实测。
证据边界
Agents API 的公开测试、功能范围、执行环境选项和费用规则来自 OpenAI 官方发布。官方页面中的客户评价属于 OpenAI 发布的第三方引述,本文没有将其当作独立验证。Orply 的报道包含一个虚构的故障调查示例,文中示例数字和结论不能当作真实生产事故或我们的测试结果。
来源
主题中心
2026 AI 编程工具全景指南
从 Copilot 改版到 Claude Code / DeepSeek 低成本方案——把分散资讯收成可搜索、可对比的工具矩阵。
进入「2026 AI 编程工具全景指南」 →赚钱视角
这个趋势怎么赚钱?
WayToClawEarn 的差异在可验证的赚钱案例,而不只是资讯。从这些复盘开始:
浏览全部案例 →