GPT-4 Turbo with Vision 正式開放 API:文字加圖片辨識模型宣告 GA
OpenAI 宣布 GPT-4 Turbo with Vision(gpt-4-turbo-2024-04-09)正式透過 API 全面開放,支援128K上下文與圖文混合輸入,結束先前的預覽限制。
OpenAI 於2024年4月9日宣布,GPT-4 Turbo with Vision 正式透過 API 全面開放(GA),模型代號 gpt-4-turbo-2024-04-09。先前僅限預覽、有使用限制的視覺辨識能力,如今成為開發者可直接在正式產品呼叫的穩定功能。單一模型可同時處理文字與圖片輸入並生成文字輸出,例如描述圖片、分析圖表、比對圖片差異、擷取表格文字。上下文維持128,000 token(約300頁文件),知識截止日更新到2023年12月。
從預覽到正式:這次公告改變了什麼
GPT-4V的視覺能力自2023年秋天就在ChatGPT網頁版與有限API預覽亮相,但過去半年開發者常受限於預覽資格、較低速率上限與穩定性未受正式保證。這次GA代表OpenAI認定視覺辨識已通過壓力測試與安全審查,可承諾服務等級,讓企業能把功能正式寫進產品路線圖。
技術整合:JSON與Function Calling並行
這次開放的視覺能力可透過標準JSON請求呼叫,也支援function calling機制,讓模型判讀圖片後能自動觸發後端函式,例如辨識發票金額後直接寫入記帳系統,把視覺AI從資訊擷取工具推向自動化流程整合。
業界反應:多模態競賽的一步棋
公告發生在多模態競爭白熱化之際——Google已推出Gemini Advanced與Gemini 1.5 Pro有限預覽,Anthropic 3月才推出具視覺理解的Claude 3系列。市場觀察者認為,OpenAI此舉是為鞏固開發者生態圈,既有帳號即可直接呼叫圖片辨識能力,無需另外簽約。
對管理者的意義
這則更新的重點在於「圖文辨識從能不能用,變成敢不敢正式用」。值得思考團隊裡哪些流程仍仰賴人工看圖判讀——盤點照片、單據影像、產品比對、現場巡檢——這些過去只能做概念驗證的場景,現在有官方穩定服務等級,可評估是否值得投入正式串接。