Gemini 讓模型自己決定怎麼看影片:agentic 影片理解上線,token 最多省 88%
Google 於 2026-09-01 在 Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite 上推出 agentic 影片理解,模型自行決定看哪一段、用什麼速度、走哪種模態,官方數據 token 最多減 88%、成本最多降 66%、準確度最多升 7%。
2026 年 9 月 1 日,Google 宣布在 Gemini 3.7 Flash、Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite 三款模型上推出「agentic 影片理解」(agentic video understanding)。這不是換一顆更大的模型,而是換掉模型「看影片的方法」。
過去模型處理影片,是以固定影格率(fixed frame rate)把整支影片從頭到尾吃進去:兩小時的監視器錄影與兩分鐘的產線片段,走的是同一套機械化流程。新做法把「怎麼看」交回模型自己決定——看哪一段、用什麼速度看(哪裡跳過、哪裡放慢逐格細看),以及透過哪一種模態取得資訊:視覺影格、音訊,還是逐字稿。以前是要模型「看完整支影片再回答」,現在是要它「自己去找答案在哪一段」。
官方數據:省的不只是錢,準確度還升
Google 公布的成效有三個數字,方向一致:
- token 消耗最多減少 88%
- 分析成本最多降低 66%
- 準確度最多提升 7%
三者同時改善,是這則新聞真正值得注意之處。多數效率優化是拿準確度換成本,這次的邏輯不同:模型不再被逼著把大量無關影格塞進上下文,雜訊變少,判斷反而更清楚。其中 Gemini 3.7 Flash 搭配 agentic 理解,在整體品質、以及品質與成本效率的組合上表現最佳。
四項具體能力與供應方式
- 次秒級片段定位(sub-second moment retrieval):能指出某個畫面出現在第幾秒,可直接用於自動剪輯。
- 長影片分析不爆 token:數小時的錄影可大幅減少必須切段處理的情況。
- 異常偵測:採自適應重取樣(adaptive resampling),效果相當於平時快轉、可疑處放慢。
- 動作與物件計數:數人數、數件數、數重複動作的精準度提升。
供應面同樣值得留意:這項能力即日起於 Google AI Studio 與 Gemini Enterprise Agent Platform 可用,Gemini App 稍後推出;價格採 Gemini API 標準 token 計價,不另外收取功能費。它不是要另外談約的高階方案,而是併入既有計價的能力升級。
對管理者的意義
企業裡的影像資料多半是「出事才調出來看」的沉睡資產——工地的監視器、產線的錄影、門市的客流畫面、會議與現場的錄影,量太大、看不完。當分析成本最多可降到約三分之一、又能大幅減少切段拼接的麻煩之後,這批資料才第一次有機會從「事後證據」變成「日常訊號」。若要試,建議選一個原本就有錄、卻從沒人看完的影像來源,先問一個很窄的問題(例如「這週有幾次未戴安全帽進場」),而不是要它「總結這支影片」——窄問題才吃得到次秒級定位與計數的好處,也才驗證得出這條路對你的場景值不值得投。