OpenAI 开发者平台双发:GPT-Live-1 语音进 API、Agents API 公开测试
2026 年 9 月 10 日,OpenAI 让 GPT-Live-1 全双工语音正式进入 API(语音层每分钟 0.05 美元、支持电话 SIP),同日开放 Agents API 公开 beta(不另收费、可选托管或自有沙箱)。企业自己的客服热线与内部智能体,现在可以用同级技术搭建。
2026 年 9 月 10 日,OpenAI 在开发者平台同日推出两项更新:GPT-Live-1 语音模型正式进入 API、公开可用;Agents API 即日起向所有开发者开放公开 beta。前者让企业能把“边听边说”的全双工语音接入自家产品与电话线路,后者让开发者通过一次 API 调用就能创建可执行任务的智能体。GPT-Live 7 月已先用于 ChatGPT 语音模式,这次的新闻重点是:同一套技术交到了第三方企业手中。
GPT-Live-1 API:语音层与推理层分开计价
GPT-Live-1 在 API 中的主要规格如下:
- 全双工对话:可以一边听、一边说,用户中途插话无需等它说完。
- 计价:语音层每分钟 0.05 美元,后端推理模型费用另计。
- 音色:新增 12 款。
- 原生语音识别:内置 ASR 转写文本、关键词偏置(让专有名词更容易被正确识别)与话轮检测。
- 连接方式:支持 WebRTC、WebSocket 与电话 SIP。
- 委派能力:推理与操作可交给 GPT-6 Astra、第三方模型或 Codex thread 处理。
设计的关键在于“语音层”与“思考层”分工:GPT-Live-1 负责听懂、接话、把握对话节奏,需要查数据或做决策时再交给后端模型。企业因此可按任务难度选择后端,成本也能分开管控。
官方评测数据
OpenAI 公布的评测数据包括:
- Tau3:以 GPT-6 Astra 作为后端时得分 83.6%,上一代 GPT-Realtime-2.1 为 45.7%。
- Full Duplex Bench:官方称提升 30 分。
- 语言学习应用 Speak 的评测:打断用户的情况减少 80%。
已落地的企业包括 Speak 与 Yelp。以上均为官方公布数据,实际表现仍取决于各企业的使用场景、语言与后端模型选择。
Agents API:一次调用创建智能体,运行环境可自选
同日开放公开 beta 的 Agents API 本身不另收费,开发者只需支付 token 与工具使用费。主要功能如下:
- 一次 API 调用即可创建智能体。
- 运行环境:使用 OpenAI 托管沙箱(与 Codex、ChatGPT 同一套基础设施),或部署在自有 VPC、合作伙伴沙箱,合作伙伴包括 Cloudflare、Vercel、Modal、E2B、Daytona、DigitalOcean、Oracle、Blaxel、Runloop。
- 内置能力:自动压缩上下文、工具搜索、程序化工具调用、并行子智能体、MCP 与 web search。
- 底层架构:采用开源的 Codex harness。
过去企业自建智能体,得处理上下文过长、工具对接、运行环境隔离等工程细节;Agents API 把这些打包成平台服务,并允许把运行环境部署在企业自己的云上,对重视数据存放位置的企业是实际的考量点。
对管理者的意义
语音与智能体这两块基础能力,现在都能以 API 形式获得。以客服热线为例,可通过 SIP 接入 GPT-Live-1,遇到查订单、改预约等需要操作的环节,交给 GPT-6 Astra 等后端模型或 Codex thread 处理;若想再搭配 Agents API 创建的内部智能体,属于企业需自行评估的组合应用,并非官方宣布已整合的功能。酒店订房、餐饮订座、电商客服这类来电量大的业务,管理者可先挑一条简单的来电流程小范围试点,记录语音分钟数与推理费用后再评估是否推广,同时事先厘清转写文本与客户数据存放在哪里、保存多久。