专栏 AI 管理编年史 第 39/217 讲 查看课程目录

GPT-4 Turbo with Vision 正式开放 API:文字加图片识别模型宣告 GA

09/04/2024 179
3:01
GPT-4 Turbo with Vision 正式开放 API:文字加图片识别模型宣告 GA

OpenAI 宣布 GPT-4 Turbo with Vision(gpt-4-turbo-2024-04-09)正式通过 API 全面开放,支持128K上下文与图文混合输入,结束此前的预览限制。

OpenAI 于2024年4月9日宣布,GPT-4 Turbo with Vision 正式通过 API 全面开放(GA),模型代号 gpt-4-turbo-2024-04-09。此前仅限预览、有使用限制的视觉识别能力,如今成为开发者可直接在正式产品调用的稳定功能。单一模型可同时处理文字与图片输入并生成文字输出,例如描述图片、分析图表、比对图片差异、提取表格文字。上下文维持128,000 token(约相当于300页文档),知识截止日更新到2023年12月。

从预览到正式:这次公告改变了什么

GPT-4V的视觉能力自2023年秋天就在ChatGPT网页版与有限API预览亮相,但过去半年开发者常受限于预览资格、较低速率上限与稳定性未受正式保证。这次GA代表OpenAI认定视觉识别已通过压力测试与安全审查,可承诺服务等级,让企业能把功能正式写进产品路线图。

技术整合:JSON与Function Calling并行

这次开放的视觉能力可通过标准JSON请求调用,也支持function calling机制,让模型判读图片后能自动触发后端函数,例如识别发票金额后直接写入记账系统,把视觉AI从信息提取工具推向自动化流程整合。

业界反应:多模态竞争白热化中的一步棋

公告发生在多模态竞争白热化之际——Google已推出Gemini Advanced与Gemini 1.5 Pro有限预览,Anthropic 3月才推出具视觉理解的Claude 3系列。市场观察者认为,OpenAI此举是为巩固开发者生态圈,现有账号即可直接调用图片识别能力,无需另外签约。

对管理者的意义

这则更新的重点在于“图文识别从能不能用,变成敢不敢正式用”。值得思考团队里哪些流程仍依赖人工看图判读——盘点照片、单据影像、产品比对、现场巡检——这些此前只能做概念验证的场景,现在有官方稳定服务等级,可评估是否值得投入正式对接。

测验检核:验证你的理解
5 篇 · 答对 80% 通过,通过后计入学习履历 登录后即可测验
问 AI:这篇文章怎么用在我的管理上?
内容由 AI 根据本文辅助生成,仅供参考,请自行判断准确性。
下一讲・AI 管理编年史 xAI 发布 Grok-1.5 Vision,首个具备视觉能力的 Grok 版本

相关文章

我们使用必要 Cookie 维持登录与语言设置,并记录使用行为以改善服务。你可以只保留必要项目。 隐私权政策