專欄 AI 管理編年史 第 39/217 講 查看課程目錄

GPT-4 Turbo with Vision 正式開放 API:文字加圖片辨識模型宣告 GA

09/04/2024 177
3:01
GPT-4 Turbo with Vision 正式開放 API:文字加圖片辨識模型宣告 GA

OpenAI 宣布 GPT-4 Turbo with Vision(gpt-4-turbo-2024-04-09)正式透過 API 全面開放,支援128K上下文與圖文混合輸入,結束先前的預覽限制。

OpenAI 於2024年4月9日宣布,GPT-4 Turbo with Vision 正式透過 API 全面開放(GA),模型代號 gpt-4-turbo-2024-04-09。先前僅限預覽、有使用限制的視覺辨識能力,如今成為開發者可直接在正式產品呼叫的穩定功能。單一模型可同時處理文字與圖片輸入並生成文字輸出,例如描述圖片、分析圖表、比對圖片差異、擷取表格文字。上下文維持128,000 token(約300頁文件),知識截止日更新到2023年12月。

從預覽到正式:這次公告改變了什麼

GPT-4V的視覺能力自2023年秋天就在ChatGPT網頁版與有限API預覽亮相,但過去半年開發者常受限於預覽資格、較低速率上限與穩定性未受正式保證。這次GA代表OpenAI認定視覺辨識已通過壓力測試與安全審查,可承諾服務等級,讓企業能把功能正式寫進產品路線圖。

技術整合:JSON與Function Calling並行

這次開放的視覺能力可透過標準JSON請求呼叫,也支援function calling機制,讓模型判讀圖片後能自動觸發後端函式,例如辨識發票金額後直接寫入記帳系統,把視覺AI從資訊擷取工具推向自動化流程整合。

業界反應:多模態競賽的一步棋

公告發生在多模態競爭白熱化之際——Google已推出Gemini Advanced與Gemini 1.5 Pro有限預覽,Anthropic 3月才推出具視覺理解的Claude 3系列。市場觀察者認為,OpenAI此舉是為鞏固開發者生態圈,既有帳號即可直接呼叫圖片辨識能力,無需另外簽約。

對管理者的意義

這則更新的重點在於「圖文辨識從能不能用,變成敢不敢正式用」。值得思考團隊裡哪些流程仍仰賴人工看圖判讀——盤點照片、單據影像、產品比對、現場巡檢——這些過去只能做概念驗證的場景,現在有官方穩定服務等級,可評估是否值得投入正式串接。

測驗檢核:驗證你的理解
5 篇 · 答對 80% 通過,通過後計入學習履歷 登入後即可測驗
問 AI:這篇文章怎麼用在我的管理上?
內容由 AI 根據本文輔助生成,僅供參考,請自行判斷準確性。
下一講・AI 管理編年史 xAI 發表 Grok-1.5 Vision,首個具視覺能力的 Grok 版本

相關文章

我們使用必要 Cookie 維持登入與語言設定,並記錄使用行為以改善服務。你可以只保留必要項目。 隱私權政策