高影响OpenAI 官方发布;The New Stack 二次报道
OpenAI GPT-Live-1 进入 API:全双工语音 Agent 开始重构传统拼接管线
OpenAI 已将 GPT-Live-1 提供给 API,开发者可使用可打断的全双工语音交互,并把更深推理与工具调用委派给后端模型。本文梳理已确认的价格、能力边界和接入前检查项。
OpenAI GPT-Live-1 API 发布:实时语音 Agent 从“拼接管线”转向全双工
OpenAI 于 2026 年 9 月 10 日宣布 GPT-Live-1 已进入 API,开发者可以把 ChatGPT Voice 背后的自然、可打断、全双工交互用于语音应用和业务流程。此次发布的关键,不只是新增一个语音模型,而是把“听、理解、回应、处理打断”放进更连续的交互环节,同时允许把更深的推理和工具调用委派给后端文本模型。
已确认的发布事实
- GPT-Live-1 已在 API 提供,前端语音层价格为 0.05 美元/分钟;后端模型和 Agent harness 的费用另计。
- 模型可以同时处理输入和输出音频,改善用户插话、沉默、背景噪音和长会话中的节奏。
- 开发者可以通过系统提示词控制语气、语速和会话风格,并可接入电话场景。
- GPT-Live-1 可以把更深的推理与工具调用委派给 GPT-6 Astra 或第三方模型;这意味着语音层与“复杂任务执行层”可以分开设计。
- OpenAI 称,早期评估中 Speak 使用 GPT-Live-1 后,学习者打断模型的次数相比此前的轮次式系统减少近 80%。这是厂商披露的早期评估,不等同于跨产品、独立实验室结论。
为什么这对 AI 应用开发者重要
过去的语音 Agent 常见架构是“语音识别 → 文本大模型 → 语音合成”,多个环节之间会产生延迟和上下文损失。GPT-Live-1 试图把实时语音交互层收敛成一个更连续的模型,同时把需要更强推理的工作交给后端模型。
这会把竞争重点从“能不能把语音接起来”推向三个更具体的问题:
- 你的业务是否真的需要可打断、低延迟的实时对话,而不是普通语音转文本?
- 哪些工具调用可以由语音层触发,哪些必须等待确认?
- 每分钟语音成本、后端推理成本、电话或实时通信基础设施费用合计后,单次任务是否仍然成立?
适合先做验证的场景
- 语言学习:让用户自然打断、停顿和改口,重点观察对话完成率,而不是只看转写准确率。
- 客服和预约:把查询、改期、取消等动作接入工具,但对退款、下单、写入 CRM 等高风险操作保留确认步骤。
- 电话销售或线索筛选:先验证接通率、有效会话率和人工接管率,再评估是否值得扩大流量。
- 现场助手:在嘈杂环境中测试背景噪音、沉默判断和网络抖动,不要只在安静的演示环境里验收。
接入前的最小检查清单
- 明确实时语音层与后端推理层的职责边界,并记录每类工具的调用权限。
- 单独计算语音层、后端模型、RTC/电话线路和存储成本。
- 为插话、静默、网络中断、误识别和重复执行准备可回放的测试集。
- 高风险动作采用“语音确认 + 可追溯日志 + 人工接管”三道门。
- 先用一个窄场景跑小流量,比较传统 STT/LLM/TTS 管线与 GPT-Live-1 的完成率、延迟和单位任务成本。
证据边界
本文把 API 已发布、能力范围和 0.05 美元/分钟前端语音层价格归为 OpenAI 官方事实;“近 80% 少打断”和 30 个百分点的基准提升均为 OpenAI 自行披露的评估结果,需在独立测试中复核。The New Stack 报道了其全双工架构、后端推理拆分和客户代码量减少案例,但不能替代生产环境的成本与可靠性测试。
来源
- OpenAI 官方发布:https://openai.com/index/introducing-gpt-live-1-in-the-api/
- The New Stack 二次报道:https://thenewstack.io/gpt-live-1-voice-api/
OpenAIGPT-Live-1voice AIAPIAI agents
主题中心
AI Agent 教程与工作流指南
比新闻更常青:按步骤搭建编程 Agent、内容流水线与 n8n 自动化,并链接到真实赚钱案例。
进入「AI Agent 教程与工作流指南」 →赚钱视角
这个趋势怎么赚钱?
WayToClawEarn 的差异在可验证的赚钱案例,而不只是资讯。从这些复盘开始:
浏览全部案例 →相关教程
免责声明:本站案例均为知识分享内容,仅供灵感与参考,不构成收益承诺;由此进行的外部执行与结果请自行判断并承担相应责任。