專欄 AI 管理編年史 第 29/217 講 查看課程目錄

OpenAI 發表 Sora:文字轉影片模型首度亮相,最長可生成60秒高畫質影片

15/02/2024 125
3:39
OpenAI 發表 Sora:文字轉影片模型首度亮相,最長可生成60秒高畫質影片

OpenAI 於2024年2月15日發表文字轉影片模型 Sora,可依文字描述生成長達60秒的高畫質影片,展現物體恆存性等物理世界模擬能力,目前僅開放紅隊測試人員與少數視覺藝術家、電影工作者做安全測試,尚未對外公開。

OpenAI 在2024年2月15日發表了新模型 Sora,這是一個「文字轉影片」(text-to-video)模型,使用者只要輸入一段文字描述,Sora 就能生成長達60秒、具備高畫質細節與流暢運鏡的影片。在當時已公開展示的同類生成式影片模型中,其時長與畫質呈現屬於明顯突破。不過 OpenAI 明確表示,Sora 目前僅為「研究預覽」(research preview),並未對一般大眾開放,初期只提供給紅隊測試人員(進行安全與濫用風險測試)以及少數受邀的視覺藝術家與電影工作者(進行創作實驗與回饋收集),尚無公開申請管道或上市時程。

技術意義:從「片段」到「世界模擬」

Sora 最受矚目的技術亮點,不是影片解析度或秒數本身,而是 OpenAI 在發表文章中強調的「物體恆存性」(object permanence)與物理世界模擬能力——也就是影片中的人物、物件在鏡頭移動、遮擋、互動後,仍能維持一致的外觀與合理的物理行為,而不是像過去許多影片生成模型那樣出現扭曲、閃爍或邏輯錯亂。OpenAI 將 Sora 定位為「世界模擬器」(world simulators)的早期研究方向,暗示其長期目標並非單純的影片生成工具,而是讓 AI 理解並模擬真實世界動態規律的一步。

與前代影片生成模型的落差

在 Sora 發表之前,市面上已有的文字轉影片工具(如 Runway Gen-2、Pika 等)多半只能生成幾秒鐘、解析度有限,且畫面容易出現物體變形或連貫性不足的片段。Sora 展示的60秒長度與畫面穩定性,在當時等於是一次世代級的跳躍,這也是為何消息一出立刻引發業界高度關注——多數同業產品的技術路線被瞬間拉開差距。

業界反應:驚豔與審慎並存

由於 OpenAI 只釋出精選展示影片與有限說明,並未開放公開測試或技術論文完整細節,業界反應呈現兩極:一方面創作者與科技媒體對展示影片的真實感驚豔不已,認為這預告了影片內容生產門檻將大幅下降;另一方面也有從業者與研究者提醒,展示影片經過篩選,實際良率、失敗案例與計算成本仍是未知數,且尚未有第三方能實際測試驗證。OpenAI 選擇先讓紅隊與少數創作者「安全測試」,也被視為公司在生成式 AI 濫用風險(如假訊息影片)上採取的謹慎姿態。

對管理者而言,這則消息本身還不是「可以立刻拿來用的工具」,但值得記錄與追蹤:一旦文字轉影片技術跨過畫質與時長的門檻,內容行銷、教育訓練短片、產品展示等場景的製作成本結構都可能被重寫,提早關注技術演進節奏,才能在工具真正開放時快速判斷是否導入。

測驗檢核:驗證你的理解
5 篇 · 答對 80% 通過,通過後計入學習履歷 登入後即可測驗
問 AI:這篇文章怎麼用在我的管理上?
內容由 AI 根據本文輔助生成,僅供參考,請自行判斷準確性。
下一講・AI 管理編年史 Google 發表開源模型 Gemma,主打端側與資源有限環境

相關文章

我們使用必要 Cookie 維持登入與語言設定,並記錄使用行為以改善服務。你可以只保留必要項目。 隱私權政策