專欄 AI 管理編年史 第 255/303 講 查看課程目錄

Gemini 讓模型自己決定怎麼看影片:agentic 影片理解上線,token 最多省 88%

01/09/2026 187
3:54
Gemini 讓模型自己決定怎麼看影片:agentic 影片理解上線,token 最多省 88%
圖/Photo by Clay Banks on Unsplash

Google 於 2026-09-01 在 Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite 上推出 agentic 影片理解,模型自行決定看哪一段、用什麼速度、走哪種模態,官方數據 token 最多減 88%、成本最多降 66%、準確度最多升 7%。

2026 年 9 月 1 日,Google 宣布在 Gemini 3.7 Flash、Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite 三款模型上推出「agentic 影片理解」(agentic video understanding)。這不是換一顆更大的模型,而是換掉模型「看影片的方法」。

過去模型處理影片,是以固定影格率(fixed frame rate)把整支影片從頭到尾吃進去:兩小時的監視器錄影與兩分鐘的產線片段,走的是同一套機械化流程。新做法把「怎麼看」交回模型自己決定——看哪一段、用什麼速度看(哪裡跳過、哪裡放慢逐格細看),以及透過哪一種模態取得資訊:視覺影格、音訊,還是逐字稿。以前是要模型「看完整支影片再回答」,現在是要它「自己去找答案在哪一段」。

官方數據:省的不只是錢,準確度還升

Google 公布的成效有三個數字,方向一致:

  • token 消耗最多減少 88%
  • 分析成本最多降低 66%
  • 準確度最多提升 7%

三者同時改善,是這則新聞真正值得注意之處。多數效率優化是拿準確度換成本,這次的邏輯不同:模型不再被逼著把大量無關影格塞進上下文,雜訊變少,判斷反而更清楚。其中 Gemini 3.7 Flash 搭配 agentic 理解,在整體品質、以及品質與成本效率的組合上表現最佳。

四項具體能力與供應方式

  • 次秒級片段定位(sub-second moment retrieval):能指出某個畫面出現在第幾秒,可直接用於自動剪輯。
  • 長影片分析不爆 token:數小時的錄影可大幅減少必須切段處理的情況。
  • 異常偵測:採自適應重取樣(adaptive resampling),效果相當於平時快轉、可疑處放慢。
  • 動作與物件計數:數人數、數件數、數重複動作的精準度提升。

供應面同樣值得留意:這項能力即日起於 Google AI Studio 與 Gemini Enterprise Agent Platform 可用,Gemini App 稍後推出;價格採 Gemini API 標準 token 計價,不另外收取功能費。它不是要另外談約的高階方案,而是併入既有計價的能力升級。

對管理者的意義

企業裡的影像資料多半是「出事才調出來看」的沉睡資產——工地的監視器、產線的錄影、門市的客流畫面、會議與現場的錄影,量太大、看不完。當分析成本最多可降到約三分之一、又能大幅減少切段拼接的麻煩之後,這批資料才第一次有機會從「事後證據」變成「日常訊號」。若要試,建議選一個原本就有錄、卻從沒人看完的影像來源,先問一個很窄的問題(例如「這週有幾次未戴安全帽進場」),而不是要它「總結這支影片」——窄問題才吃得到次秒級定位與計數的好處,也才驗證得出這條路對你的場景值不值得投。

測驗檢核:驗證你的理解
5 篇 · 答對 80% 通過,通過後計入學習履歷 登入後即可測驗
問 AI:這篇文章怎麼用在我的管理上?
內容由 AI 根據本文輔助生成,僅供參考,請自行判斷準確性。
下一講・AI 管理編年史 Gemini 3.8 Flash 與 Flash Cyber 發表:三週內第三款 Flash,入門價撐到年底

相關文章

我們使用必要 Cookie 維持登入與語言設定,並記錄使用行為以改善服務。你可以只保留必要項目。 隱私權政策