專欄 AI 管理編年史 第 69/217 講 查看課程目錄

OpenAI 推出 Predicted Outputs:靠「預測答案」讓 GPT-4o 改稿快 3–5 倍

04/11/2024 229
3:36
OpenAI 推出 Predicted Outputs:靠「預測答案」讓 GPT-4o 改稿快 3–5 倍

OpenAI 為 GPT-4o 與 GPT-4o-mini 新增 Predicted Outputs API 參數,透過投機解碼技術跳過已知內容的重新生成,讓文件與程式碼修改類任務提速 3–5 倍,但預測落空仍照樣計費。

OpenAI 在 2024 年 11 月 4 日發表一項新的 API 功能:Predicted Outputs。這是 GPT-4o 與 GPT-4o-mini 的新參數,鎖定的是一種常見情境——當你要模型輸出的內容「大部分已知、只需小幅修改」時,例如把一段程式碼改一個函式名稱,或把一份文件調整幾句話。過去這類任務,模型必須把整段內容從頭到尾重新生成一次,即使 90% 的字句根本沒變;Predicted Outputs 讓開發者可以先把「預期的答案」(prediction)連同請求一起送出,模型只需要並行驗證這份預測是否正確,命中的部分直接跳過生成,官方數據顯示重寫、程式碼編輯這類任務的回應速度可提升 3 到 5 倍。

計費規則值得特別留意:如果你提供的預測內容最終沒有被採用(模型判斷需要改寫的地方比預期多),那些「猜錯」的 token 仍然會依照一般 completion token 的費率收費,不會因為沒用到就免費。OpenAI 也在回應中新增了 rejected_prediction_tokens 欄位,讓開發者可以清楚看到有多少預測 token 被判定失效,方便評估這個功能對自己的任務類型划不划算。

技術意義:投機解碼從研究概念走進生產 API

Predicted Outputs 背後用的是「投機解碼」(speculative decoding)——這原本是學界與推理引擎優化圈已經討論多年的技術思路:先用低成本方式產生一份候選答案,再讓大模型平行驗證,命中就省下逐字生成的運算量。過去這類優化多半藏在推理框架底層,一般開發者感受不到;OpenAI 這次把它做成一個開發者可以主動調用的 API 參數,等於把「加速」的主導權交到使用者手上——你越清楚自己要改的內容有多少比例不變,就越能吃到這個功能的紅利。

與既有做法的差異:不是降價,是換一種計費邏輯的加速

過去 OpenAI 多半透過模型體積縮小(如 GPT-4o-mini)或直接調降 token 價格來降低成本,這次不同的是純粹針對「延遲」下手,且伴隨一個新的風險變數:預測錯了照樣付費。這意味著這個功能更適合「大部分內容確定、少部分需要修改」的重複性編輯任務,而不適合從零生成全新內容的場景——用錯情境反而可能增加成本,而非省錢。

對管理者的意義

如果團隊的 AI 應用場景是「大量、重複的文件微調或程式碼小修改」(例如合約模板批次更新、報表格式調整),這類任務用 Predicted Outputs 有機會明顯壓低等待時間;但導入前建議先小規模測試命中率,避免預測落空的 token 費用反而墊高了整體成本。

測驗檢核:驗證你的理解
5 篇 · 答對 80% 通過,通過後計入學習履歷 登入後即可測驗
問 AI:這篇文章怎麼用在我的管理上?
內容由 AI 根據本文輔助生成,僅供參考,請自行判斷準確性。
下一講・AI 管理編年史 Google 發表實驗模型 Gemini-exp-1114,社群投票登頂 LMArena 綜合榜

相關文章

我們使用必要 Cookie 維持登入與語言設定,並記錄使用行為以改善服務。你可以只保留必要項目。 隱私權政策