專欄 AI 管理編年史 第 43/217 講 查看課程目錄

OpenAI發表GPT-4o 語音視覺即時全能

13/05/2024 213
3:48
OpenAI發表GPT-4o 語音視覺即時全能

OpenAI於「Spring Update」發表新旗艦模型GPT-4o,具備語音、視覺、文字即時整合處理能力,回應延遲趨近真人對話,且首次讓免費用戶也能使用最先進模型。

2024年5月13日,OpenAI在線上直播「Spring Update」中發表新一代旗艦模型GPT-4o,「o」代表omni(全能)。GPT-4o最大亮點是能即時整合處理語音、視覺與文字三種輸入輸出,語音對話的回應延遲大幅縮短,平均僅232毫秒,已接近真人對話的自然速度。示範中,模型能即時偵測使用者語氣起伏、被打斷時隨即停下並重新回應,也能透過鏡頭辨識現場畫面並即時描述、甚至判斷使用者情緒狀態。OpenAI同時發表桌面版ChatGPT應用程式,並宣布GPT-4o將開放給免費版ChatGPT用戶使用(有限額度),付費用戶則享有更高的使用額度。

技術意義:語音助理從「你說完換我說」變成真對話

過去語音助理(包含先前版本的ChatGPT語音模式)多是「語音轉文字→模型理解→文字轉語音」三段式處理,每一段都疊加延遲,回應往往要等上明顯較久的時間,對話也難以被打斷。GPT-4o改為單一模型直接處理語音輸入輸出,不需中間轉換,才讓延遲壓到232毫秒、逼近人類對話的反應速度。這代表語音互動介面(語音助理、客服機器人、教學陪練)第一次有機會做到「自然打斷、即時反應」,而不是舊有的「錄音-等待-播放」模式。

與前代比較:免費開放是策略轉向

GPT-4o在能力上是GPT-4 Turbo的延伸與整合,但真正的轉折點是商業策略:這是OpenAI首次把「目前最先進的模型」直接開放給免費用戶使用(雖然有額度限制),而非像過去把最新模型留給付費訂閱戶專用。此舉被視為對Google(當時剛以Gemini 1.5系列布局)、以及開源陣營(Llama、Grok等免費可用模型)持續壓境的回應——透過擴大免費使用者的觸及面,鞏固ChatGPT的用戶基礎與品牌領先地位。

業界反應:即時多模態成為下一波競賽焦點

發表後,科技業與媒體討論的焦點多集中在「即時語音視覺互動」是否會成為下一代人機介面的標準形態,而不只是聊天工具的升級。分析普遍認為,GPT-4o把「回應速度」與「多模態理解」同時做到位,等於重新定義了語音助理的體驗門檻,連帶讓其他家(Google、Meta)後續的語音/多模態產品都必須以「接近即時」為基本比較基準。

對管理者而言,這則發表的意義在於:語音與視覺的即時AI互動,首次具備成為第一線工作介面(客服對話、門市導購、現場巡檢問答)的技術條件,而且免費版開放使用降低了團隊試用的門檻,值得留意接下來數月是否有更貼近企業場景的應用出現。

測驗檢核:驗證你的理解
5 篇 · 答對 80% 通過,通過後計入學習履歷 登入後即可測驗
問 AI:這篇文章怎麼用在我的管理上?
內容由 AI 根據本文輔助生成,僅供參考,請自行判斷準確性。
下一講・AI 管理編年史 Google I/O 2024:Gemini 1.5全面開放、Project Astra登場、AI搜尋摘要大規模上線

相關文章

我們使用必要 Cookie 維持登入與語言設定,並記錄使用行為以改善服務。你可以只保留必要項目。 隱私權政策