OpenAI 把图片生成直接塞进 GPT-4o,一夜爆红的吉卜力风潮
OpenAI 于2025年3月25日宣布图片生成能力原生整合进GPT-4o,取代DALL·E 3成为新一代图片生成器,能精准渲染文字、通过对话反复修图,并因吉卜力动画风格图片在社交媒体爆红。
OpenAI 于2025年3月25日宣布,将图片生成能力直接整合进 GPT-4o 模型,推出号称「迄今最先进」的图片生成器。这项功能不再是独立的 DALL·E 3 系统,而是原生内置于 GPT-4o 本身,并开始在 ChatGPT 与 Sora 中,向所有 Plus、Pro、Team 及免费用户开放。
根据官方说明,新的生成方式能产出更精准、更真实的图像,最大突破之一是能正确渲染文字——这是过去 DALL·E 系列图片生成器长期的弱点,常出现扭曲、错字的招牌与标语。由于能力内置于对话模型本身,用户可以像聊天一样,通过自然语言反复调整、修改图片,GPT-4o 也能延续对话上下文与先前上传的图片,保持系列图像的一致性。
技术意义:从「调用外部工具」到「模型原生能力」
过去 ChatGPT 生成图片,本质上是文字模型调用另一个独立的 DALL·E 模型来完成,两者是分工合作的两套系统。这次的改变是把图片生成能力「焊」进 GPT-4o 这个多模态模型本体,模型能同时理解文字脉络、先前的图片、以及用户的修改意图,一次到位地生成或修改图像。这也是为什么用户能像聊天一样持续微调图片,而不用每次都重新下一个独立的生成指令。
业界反应:吉卜力风潮意外成为现象级传播
这项功能上线后,因为能够将真实照片转换成吉卜力工作室(Studio Ghibli)动画风格的图像,在社交媒体上引发大规模分享与讨论,许多用户把自己、家人、宠物的照片转成宫崎骏式画风后发布到社交平台,形成一波自发性的病毒式传播。这种现象也连带引出关于艺术风格模仿与版权边界的公开讨论,成为这次功能发布之外的另一个话题。
对管理者的意义
图片生成从「需要另外开工具、另外下指令」变成「聊天当下就能做」,意味着营销、社群运营、门店的视觉内容制作门槛大幅降低——不必等设计资源,主管与一线同仁自己就能在对话中快速产出宣传图、菜单视觉或活动海报草稿,值得评估是否能补上团队在快速视觉内容产制上的缺口。
大家怎么说 · 6 条留言