OpenAI 開發者平台雙發:GPT-Live-1 語音進 API、Agents API 公開測試
2026 年 9 月 10 日,OpenAI 讓 GPT-Live-1 全雙工語音正式進入 API(語音層每分鐘 0.05 美元、支援電話 SIP),同日開放 Agents API 公開 beta(不另收費、可選代管或自有沙箱)。企業自家的客服電話與內部代理,現在可以用同級技術打造。
2026 年 9 月 10 日,OpenAI 在開發者平台同日推出兩項更新:GPT-Live-1 語音模型正式進入 API、公開可用;Agents API 即日起對所有開發者開放公開 beta。前者讓企業能把「邊聽邊說」的全雙工語音接進自家產品與電話線路,後者讓開發者用單一 API 呼叫就能建出可執行任務的代理。GPT-Live 在 7 月已先用於 ChatGPT 語音模式,這次的新聞重點是:同一套技術交到第三方企業手上。
GPT-Live-1 API:語音層與推理層分開計價
GPT-Live-1 在 API 中的主要規格如下:
- 全雙工對話:可以一邊聽、一邊說,使用者中途插話不必等它講完。
- 計價:語音層每分鐘 0.05 美元,後端推理模型費用另計。
- 聲音:新增 12 款。
- 原生語音辨識:內建 ASR 逐字稿、關鍵字偏置(讓專有名詞更容易辨識正確)與輪次偵測。
- 連線方式:支援 WebRTC、WebSocket 與電話 SIP。
- 委派能力:推理與動作可交給 GPT-6 Astra、第三方模型或 Codex thread 處理。
設計的關鍵在「語音層」與「思考層」分工:GPT-Live-1 負責聽懂、接話、掌握對話節奏,需要查資料或做決定時再交給後端模型。企業因此可依任務難度挑選後端,成本也能分開控管。
官方評測數據
OpenAI 公布的評測數字包括:
- Tau3:以 GPT-6 Astra 作為後端時得分 83.6%,前代 GPT-Realtime-2.1 為 45.7%。
- Full Duplex Bench:官方稱提升 30 分。
- 語言學習應用 Speak 的評測:打斷使用者的情況減少 80%。
已導入的企業包括 Speak 與 Yelp。以上皆為官方公布數據,實際表現仍取決於各企業的使用情境、語言與後端模型選擇。
Agents API:一個呼叫建出代理,執行環境可自選
同日開放公開 beta 的 Agents API 本身不另收費,開發者只需支付 token 與工具使用費。主要功能如下:
- 單一 API 呼叫即可建立代理。
- 執行環境:使用 OpenAI 代管沙箱(與 Codex、ChatGPT 同一套基礎設施),或放在自有 VPC、夥伴沙箱,夥伴包括 Cloudflare、Vercel、Modal、E2B、Daytona、DigitalOcean、Oracle、Blaxel、Runloop。
- 內建能力:自動壓縮上下文、工具搜尋、程式化工具呼叫、平行子代理、MCP 與 web search。
- 底層架構:採用開源的 Codex harness。
過去企業自建代理,得處理上下文過長、工具串接、執行環境隔離等工程細節;Agents API 把這些打包成平台服務,並允許執行環境放在自家雲端,對重視資料存放位置的企業是實際的考量點。
對管理者的意義
語音與代理這兩塊基礎能力,現在都能以 API 形式取得。以客服電話為例,可透過 SIP 接上 GPT-Live-1,遇到查訂單、改預約等需要動作的環節,交給 GPT-6 Astra 等後端模型或 Codex thread 處理;若想再搭配 Agents API 建出的內部代理,屬於企業需自行評估的組合應用,並非官方宣布已整合的功能。飯店訂房、餐飲訂位、電商客服這類來電量大的業務,管理者可先挑一條單純的來電流程小規模試行,記錄語音分鐘數與推理費用後再評估是否擴大,同時事先釐清逐字稿與客戶資料存放在哪裡、保存多久。