Google 发布 Gemini Omni 1.1 Flash:视频生成新增场景延伸、首尾帧、360p 草稿与 4K 输出
Google DeepMind 于 2026 年 8 月 27 日发布视频生成模型 Gemini Omni 1.1 Flash:场景延伸改看前 10 秒上下文、可指定首尾帧、新增 360p 草稿模式(相较 720p 最多快 60%、成本三分之一)与 1080p/4K 输出,Gemini API 即日可用。本文解读技术意义、价格分层策略与对管理者的启示。
Google DeepMind 于 2026 年 8 月 27 日(美西时间)在 Google 官方博客发布 Gemini Omni 1.1 Flash,由产品经理 Anish Nangia 与 Alisa Fortin 署名。这是 Google 视频生成与编辑多模态模型的新版本,即日起在 Gemini API(Google AI Studio)开放,同步进入 Gemini Enterprise Agent Platform;创作工具 Google Flow 对 AI Plus/Pro/Ultra 订阅用户开放,Gemini App 的场景延伸功能则面向全球 Plus/Pro/Ultra 订阅用户推出。
五项新功能:从“单次生成”走向“可延续、可控制的制作”
- 场景延伸:模型分析前 10 秒的上下文(前代只看最后 1 秒),每次可延长 10 秒、最长 40 秒,并保持角色、光线与叙事一致。
- 指定首尾帧:给出起始与结束画面,模型自动生成中间的连续镜头与运镜。
- 360p 草稿模式:相较 720p 标准模式最多快 60%、成本只有三分之一,用来快速打样。
- 1080p/4K 高分辨率输出:供专业制作与正式交付使用。
- 视频参考:可上传最多 3 秒的外部片段,作为角色或动态的风格参考。
定价以“每秒输出”计算:360p 为 0.03 美元、720p 为 0.10 美元、1080p 为 0.15 美元、4K 为 0.30 美元。
技术意义:上下文窗口从 1 秒拉到 10 秒
视频生成模型长期的痛点是“一延长就走样”——角色换脸、光线跳动、动作接不上。前代仅以最后 1 秒作为延伸依据,模型其实不知道前面发生了什么;1.1 Flash 把参考上下文拉到 10 秒,等于让模型记住完整的一个镜头段落,叙事才可能连贯。首尾帧则是把动画行业的“关键帧”工作法搬进生成模型:人决定起点与终点,机器负责补间。两者加起来,生成视频开始具备“可导演性”,而不只是抽卡式的随机输出。
与竞品比较:用价格分层打开“先草稿再精修”的节奏
360p 草稿模式是本次最务实的设计。多数视频生成工具没有独立的低分辨率草稿价位,反复修改提示词往往按正式输出的价格计费,试错成本很快失控。Google 把草稿定在 720p 标准模式三分之一的价格、最多快六成,明确引导用户“用 360p 反复试、确定后再出 4K”,与软件行业“先原型再量产”的逻辑一致;按 4K 每秒 0.30 美元计,一条 30 秒短视频约 9 美元。the-decoder、Neowin 等媒体于同日跟进报道;从 API 首发与定价透明的策略看,Google 显然瞄准开发者市场,与 OpenAI Sora、快手可灵(Kling)、Runway 正面竞争。
对管理者的意义
对在泰国经营电商、零售或酒店的管理者而言,这则新闻的重点不是“AI 又能做视频了”,而是制作流程的成本结构变了:营销短视频的试错成本降到每秒几美分,且能指定首尾画面锁住品牌调性。若团队已有素材,可先用 360p 草稿测三到五个版本,内部拍板后再输出 4K 上线,把外包剪辑来回的时间压缩到一天之内。