Gemini 让模型自己决定怎么看视频:agentic 视频理解上线,token 最多省 88%
谷歌于 2026-09-01 在 Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite 上推出 agentic 视频理解,模型自行决定看哪一段、用什么速度、走哪种模态,官方数据 token 最多减 88%、成本最多降 66%、准确度最多升 7%。
2026 年 9 月 1 日,谷歌宣布在 Gemini 3.7 Flash、Gemini 3.6 Flash 与 Gemini 3.5 Flash-Lite 三款模型上推出「agentic 视频理解」(agentic video understanding)。这不是换一颗更大的模型,而是换掉模型「看视频的方法」。
过去模型处理视频,是以固定帧率(fixed frame rate)把整支视频从头到尾吃进去:两小时的监控录像与两分钟的产线片段,走的是同一套机械化流程。新做法把「怎么看」交回模型自己决定——看哪一段、用什么速度看(哪里跳过、哪里放慢逐帧细看),以及通过哪一种模态获取信息:视觉帧、音频,还是文字稿。以前是要模型「看完整支视频再回答」,现在是要它「自己去找答案在哪一段」。
官方数据:省的不只是钱,准确度还升
谷歌公布的成效有三个数字,方向一致:
- token 消耗最多减少 88%
- 分析成本最多降低 66%
- 准确度最多提升 7%
三者同时改善,是这则新闻真正值得注意之处。多数效率优化是拿准确度换成本,这次的逻辑不同:模型不再被迫把大量无关帧塞进上下文,噪声变少,判断反而更清楚。其中 Gemini 3.7 Flash 搭配 agentic 理解,在整体质量、以及质量与成本效率的组合上表现最佳。
四项具体能力与供给方式
- 亚秒级片段定位(sub-second moment retrieval):能指出某个画面出现在第几秒,可直接用于自动剪辑。
- 长视频分析不爆 token:数小时的录像可大幅减少必须切段处理的情况。
- 异常检测:采用自适应重采样(adaptive resampling),效果相当于平时快进、可疑处放慢。
- 动作与物体计数:数人数、数件数、数重复动作的精准度提升。
供给面同样值得留意:这项能力即日起于 Google AI Studio 与 Gemini Enterprise Agent Platform 可用,Gemini App 稍后推出;价格采用 Gemini API 标准 token 计价,不另外收取功能费。它不是一个要另外谈合同的高阶方案,而是并入既有计价的能力升级。
对管理者的意义
企业里的影像数据多半是「出事才调出来看」的沉睡资产——工地的监控、产线的录像、门店的客流画面、会议与现场的录像,量太大、看不完。当分析成本最多可降到约三分之一、又能大幅减少切段拼接的麻烦之后,这批数据才第一次有机会从「事后证据」变成「日常信号」。若要试,建议选一个本来就有录、却从没人看完的影像来源,先问一个很窄的问题(例如「这周有几次未戴安全帽进场」),而不是要它「总结这支视频」——窄问题才吃得到亚秒级定位与计数的好处,也才验证得出这条路对你的场景值不值得投。