Grok Imagine Video 1.5正式上线:音画同步生成,价格砍到Sora 2 Pro的14%
xAI旗下Grok Imagine的视频生成功能Video 1.5正式脱离预览阶段全面上线,支持音画同步生成,并登陆Imagine API、grok.com网站与iOS/Android应用,定价较OpenAI Sora 2 Pro同等级方案低86%,把AI视频生成的价格战推向新低点。
xAI于2026年6月17日宣布,旗下视频生成工具Grok Imagine的「Video 1.5」模型正式结束预览测试阶段,全面对外开放。这次更新最大的技术亮点是「音画同步生成」——用户输入一段文字或图片提示后,系统会一次性产出画面与对应的环境音、对白甚至背景音乐,不需要像过去那样先生成无声视频、再另外叠加音效轨。Video 1.5同步登陆四个渠道:开发者可通过Imagine API接入、普通用户可在grok.com网站直接生成、也可通过iOS与Android版的Grok App使用,等于同时覆盖了开发者、网页用户与移动端三种使用场景。
定价策略是这次发布最受关注的部分。xAI公布的资费显示,Video 1.5的生成成本较OpenAI同级的Sora 2 Pro方案低了86%,换算下来只要对手约七分之一的价格。这个定价落差在AI视频生成这个仍处于烧钱竞赛的领域里相当罕见,等于把「用得起AI视频工具」的门槛,从原本主要是大型制作团队或营销代理商,一口气拉低到中小企业、甚至个人创作者都能负担的范围。
技术意义:音画同步不只是省一道工序
过去多数AI视频生成工具(包括早期的Sora、Runway等)采取的是「先画面后配音」的两阶段流程,画面和声音是两套独立生成的模型,容易出现嘴型对不上台词、音效节奏和画面动作脱节的问题。Video 1.5把音画放进同一个生成流程处理,理论上能让对话、动作音效与画面律动更贴合,这对需要对嘴说话、有明确动作节奏的短视频内容(例如产品开箱、人物讲解)会是明显的品质提升,而不只是「少剪一步」的效率问题。
与Sora 2 Pro的定位差异
OpenAI的Sora 2 Pro走的是更高阶、面向专业影视与广告制作的定位,强调画质与可控性,定价相对较高;xAI这次选择用价格战切入,诉求的是「量」——鼓励开发者和普通用户大量尝试、高频率生成短内容,而非追求单支视频的极致品质。两者短期内不必然是正面对撞,比较像是在同一个市场切出了「精品」与「量产」两条不同赛道,但86%的价差幅度已经足以让不少原本犹豫是否要导入AI视频工具的中小型团队,重新评估Sora阵营的必要性。
业界反应:价格战会不会压缩到品质投资
多方观察指出,这轮定价策略延续了xAI近半年来在Grok系列产品上「先冲用量、后谈获利」的一贯打法,与OpenAI、Google DeepMind在文字模型上的竞争逻辑类似,只是这次战场转移到视频生成。部分业界声音则担心,激烈的价格竞争可能让厂商为了压低算力成本而牺牲模型的细节表现,值得后续观察Video 1.5在复杂场景、长镜头生成上的实际稳定度是否能撑住这个价位。
对管理者而言,这则新闻的意义不在于要不要立刻导入某个特定工具,而是提醒:AI视频生成的成本门槛正在快速下探,原本被视为「需要外包或专业团队」的短视频、产品介绍视频、内部培训短片等内容,正在变成内部营销或人资部门可以自行低成本量产的日常工作项目,值得评估是否该提前布局相关流程与人才技能。