Google I/O 2026:正式推出 Gemini 3.5 与 Gemini Omni,视频生成迈入「任意输入」新阶段
Google 在 I/O 2026 开发者大会上宣布进入「代理型 Gemini 时代」,同步发布 Gemini 3.5(强化代理与编程能力)与 Gemini Omni(可将图片、文字、视频、音频等任意素材转换为单一视频输出)。
Google 于 2026 年 5 月 19 日的 I/O 开发者大会上,由首席执行官 Sundar Pichai 主题演讲宣布正式进入「代理型 Gemini 时代」,同步推出两项核心更新:主打前沿智能与代理任务、编程能力的「Gemini 3.5」,以及全新生成模型「Gemini Omni」。Gemini Omni 结合 Gemini 的推理能力与 Google 生成式媒体技术,能将图片、文字、已有视频片段、音频等任意参考素材,整合转换为单一连贯的视频输出,并引入 Google 对物理世界的理解(重力、动能、流体力学等),使生成画面更符合真实物理逻辑。
性能数字说话:Gemini 3.5 Flash 逼近甚至超越前代旗舰
Google 公布的基准测试显示,轻量版模型「Gemini 3.5 Flash」在多项指标上超越前一代旗舰「Gemini 3.1 Pro」:Terminal-Bench 2.1 达 76.2%(对比 3.1 Pro 的 70.3%)、MCP Atlas 达 83.6%(对比 78.2%)、Finance Agent v2 达 57.9%(对比 43.0%)、GDPval-AA 达 1656 Elo(对比 1314),多模态理解测试 CharXiv Reasoning 更达 84.2%。Google 并宣称其输出速度较其他前沿模型快四倍。Gemini 3.5 Flash 已于发布当日同步全面上线 Gemini API、Google AI Studio、Google Antigravity、Vertex AI、Gemini App 与 Google 搜索的 AI 模式。
Gemini Omni:从「文字转视频」到「任意素材转视频」
过去一年市面上的视频生成工具多以文字提示词为主要输入方式,Gemini Omni 的突破在于能同时理解图片、文字、已有视频片段与音频素材,将它们融合成风格与内容连贯的新视频,并可用「电影运镜」「更换背景」等简单对话式指令进行编辑。目前「Gemini Omni Flash」版本已对 Google AI Plus、Pro、Ultra 订阅用户开放,可通过 Gemini App 与 Google Flow 使用;YouTube Shorts Remix 与 YouTube Create App(限 18 岁以上用户)也可免费使用,开发者与企业客户预计在未来数周内通过 Gemini API 与 Agent Platform API 陆续开放。所有生成视频均嵌入 Google 的 SynthID 数字水印,可在 Gemini App、Chrome 与搜索中验证来源。
业界解读:Google 加码视频生成与科研应用两端
科技媒体普遍将 Gemini Omni 视为 Google 对 OpenAI 及其他视频生成模型近期动作的正面回应——目前多数对手仍局限于单一模态输入,Google 选择以「任意输入整合」与「物理真实感」作为差异化切入点。同场大会上,Google DeepMind 也宣布将互动世界生成工具 Project Genie 与近 20 年的 Google 街景影像数据串接,用于生成以真实地理为基础的虚拟世界;另推出整合 AI Co-Scientist、AlphaEvolve 等系统的「Gemini for Science」科研工具套件。分析认为,Gemini 3.5 Flash 的全面上线对现有开发者影响更为直接(关系到 API 调用成本与响应速度),Gemini Omni 则需要更长时间观察实际生成质量、版权争议与商用稳定度。
对管理者的意义
对于需要制作产品介绍、培训短片或社媒营销内容的管理者而言,Gemini Omni Flash 已可在多数员工日常使用的 Gemini App 与 Google Flow 中直接尝试——不必等专业剪辑团队,用手边的产品照片和一段口头说明就可能生成初版视频素材,并自带水印利于内容溯源。建议先确认企业订阅方案的授权范围与素材版权争议,再评估是否纳入常态内容生产流程。