专栏 AI 管理编年史 第 29/217 讲 查看课程目录

OpenAI 发布 Sora:文字转视频模型首次亮相,最长可生成60秒高清视频

15/02/2024 127
3:39
OpenAI 发布 Sora:文字转视频模型首次亮相,最长可生成60秒高清视频

OpenAI 于2024年2月15日发布文字转视频模型 Sora,可依据文字描述生成长达60秒的高清视频,展现物体恒存性等物理世界模拟能力,目前仅开放红队测试人员与少数视觉艺术家、电影工作者做安全测试,尚未对外公开。

OpenAI 在2024年2月15日发布了新模型 Sora,这是一个“文字转视频”(text-to-video)模型,用户只需输入一段文字描述,Sora 就能生成长达60秒、具备高清细节与流畅运镜的视频。在当时已公开展示的同类生成式视频模型中,其时长与画质表现属于明显突破。不过 OpenAI 明确表示,Sora 目前仅为“研究预览”(research preview),并未对普通大众开放,初期只提供给红队测试人员(进行安全与滥用风险测试)以及少数受邀的视觉艺术家与电影工作者(进行创作实验与反馈收集),尚无公开申请渠道或上市时间表。

技术意义:从“片段”到“世界模拟”

Sora 最受关注的技术亮点,不是视频分辨率或秒数本身,而是 OpenAI 在发布文章中强调的“物体恒存性”(object permanence)与物理世界模拟能力——也就是视频中的人物、物体在镜头移动、遮挡、互动后,仍能保持一致的外观与合理的物理行为,而不是像过去许多视频生成模型那样出现扭曲、闪烁或逻辑混乱。OpenAI 将 Sora 定位为“世界模拟器”(world simulators)的早期研究方向,暗示其长期目标并非单纯的视频生成工具,而是让 AI 理解并模拟真实世界动态规律的一步。

与前代视频生成模型的差距

在 Sora 发布之前,市面上已有的文字转视频工具(如 Runway Gen-2、Pika 等)大多只能生成几秒钟、分辨率有限,且画面容易出现物体变形或连贯性不足的片段。Sora 展示的60秒长度与画面稳定性,在当时相当于一次世代级的跳跃,这也是为何消息一出立刻引发业界高度关注——多数同行产品的技术路线被瞬间拉开差距。

业界反应:惊艳与审慎并存

由于 OpenAI 只释出精选展示视频与有限说明,并未开放公开测试或技术论文完整细节,业界反应呈现两极:一方面创作者与科技媒体对展示视频的真实感赞叹不已,认为这预告了视频内容生产门槛将大幅下降;另一方面也有从业者与研究者提醒,展示视频经过筛选,实际良率、失败案例与计算成本仍是未知数,且尚未有第三方能实际测试验证。OpenAI 选择先让红队与少数创作者“安全测试”,也被视为公司在生成式 AI 滥用风险(如虚假信息视频)上采取的谨慎姿态。

对管理者而言,这则消息本身还不是“可以立刻拿来用的工具”,但值得记录与追踪:一旦文字转视频技术跨过画质与时长的门槛,内容营销、培训短片、产品展示等场景的制作成本结构都可能被重写,提早关注技术演进节奏,才能在工具真正开放时快速判断是否导入。

测验检核:验证你的理解
5 篇 · 答对 80% 通过,通过后计入学习履历 登录后即可测验
问 AI:这篇文章怎么用在我的管理上?
内容由 AI 根据本文辅助生成,仅供参考,请自行判断准确性。
下一讲・AI 管理编年史 谷歌发布开源模型 Gemma,主打端侧与资源有限环境

相关文章

我们使用必要 Cookie 维持登录与语言设置,并记录使用行为以改善服务。你可以只保留必要项目。 隐私权政策