Gemini Omni Flash開發者預覽上線 Google AI Studio與API開放、10秒影片生成上限
Google DeepMind於2026年6月30日開放Gemini Omni Flash開發者公開預覽,透過Google AI Studio與Gemini API即可呼叫,目前單次影片生成上限為10秒,主打多模態統一輸出與低延遲。
Google DeepMind於2026年6月30日宣布,多模態模型「Gemini Omni Flash」進入開發者公開預覽,開放透過Google AI Studio與Gemini API呼叫。官方將文字、圖片、音訊、影片的生成能力整合進單一模型端點,開發者不必再依輸出型態分別呼叫不同模型。本次預覽同時標示,影片生成功能設有10秒的單次上限,屬公開測試階段的安全閥,用意在控管運算成本與內容審查風險,並非模型技術的天花板。Omni Flash延續「Flash」系列定位:以較低的生成品質換取更低延遲與呼叫成本,鎖定聊天機器人動態貼圖、社群短影音測試稿、電商商品展示片段等大量、即時、低成本的應用場景。
技術意義與競品比較
過去要讓AI同時產生文案、示意圖與短片,開發者常得串接多套模型分頭處理,格式與風格不易對齊。Omni Flash把三種輸出收斂進同一推論流程,呼應近一年業界從「多模型拼接」走向「單一模型多輸出」的架構趨勢。相較部分競品已開放數十秒甚至分鐘級的影片生成,Omni Flash預覽階段10秒的上限明顯保守,反映Google DeepMind採取「先開放取用、再逐步放寬時長」的分階段策略,優先觀察呼叫模式與內容審查壓力,而非一次衝規格數字。
業界反應
開發者社群討論焦點集中在呼叫成本、速率限制與商用授權條款,多數反映10秒雖不利完整敘事型短片,但用於「快速產生草稿、再交由人工延展」的工作流程已足夠實用。對管理者而言,真正值得留意的是「單一呼叫、多模態輸出」的方向本身——未來內容草案的產製門檻可能進一步降低,值得讓內部團隊趁預覽階段申請試用、評估實際效益。