OpenAI 推出 Predicted Outputs:靠“预测答案”让 GPT-4o 改稿快 3–5 倍
OpenAI 为 GPT-4o 与 GPT-4o-mini 新增 Predicted Outputs API 参数,通过投机解码技术跳过已知内容的重新生成,让文档与代码修改类任务提速 3–5 倍,但预测落空仍照样计费。
OpenAI 在 2024 年 11 月 4 日发布一项新的 API 功能:Predicted Outputs。这是 GPT-4o 与 GPT-4o-mini 的新参数,针对的是一种常见场景——当你要模型输出的内容“大部分已知、只需小幅修改”时,比如把一段代码改一个函数名,或把一份文档调整几句话。过去这类任务,模型必须把整段内容从头到尾重新生成一次,哪怕 90% 的文字根本没变;Predicted Outputs 让开发者可以先把“预期的答案”(prediction)连同请求一起发送,模型只需并行验证这份预测是否正确,命中的部分直接跳过生成,官方数据显示重写、代码编辑这类任务的响应速度可提升 3 到 5 倍。
计费规则需要特别留意:如果提供的预测内容最终没有被采用(模型判断需要改写的地方比预期多),那些“猜错”的 token 依然会按照普通 completion token 的费率收费,不会因为没用到就免费。OpenAI 也在响应中新增了 rejected_prediction_tokens 字段,让开发者能清楚看到有多少预测 token 被判定失效,方便评估这个功能对自身任务类型是否划算。
技术意义:投机解码从研究概念走进生产 API
Predicted Outputs 背后用的是“投机解码”(speculative decoding)——这原本是学界与推理引擎优化圈已经讨论多年的技术思路:先用低成本方式生成一份候选答案,再让大模型并行验证,命中就省下逐字生成的运算量。过去这类优化多半藏在推理框架底层,普通开发者感受不到;OpenAI 这次把它做成一个开发者可以主动调用的 API 参数,等于把“加速”的主导权交到使用者手中——你越清楚自己要改的内容有多少比例不变,就越能吃到这个功能的红利。
与既有做法的差异:不是降价,是换一种计费逻辑的加速
过去 OpenAI 多半通过模型体积缩小(如 GPT-4o-mini)或直接下调 token 价格来降低成本,这次不同的是纯粹针对“延迟”下手,且伴随一个新的风险变量:预测错了照样付费。这意味着这个功能更适合“大部分内容确定、少部分需要修改”的重复性编辑任务,不适合从零生成全新内容的场景——用错场景反而可能增加成本,而非省钱。
对管理者的意义
如果团队的 AI 应用场景是“大量、重复的文档微调或代码小修改”(比如合同模板批量更新、报表格式调整),这类任务用 Predicted Outputs 有机会明显压低等待时间;但导入前建议先小规模测试命中率,避免预测落空的 token 费用反而推高整体成本。