专栏 AI 管理编年史 第 41/217 讲 查看课程目录

xAI 发布 Grok-1.5 Vision,首个具备视觉能力的 Grok 版本

12/04/2024 153
3:59
xAI 发布 Grok-1.5 Vision,首个具备视觉能力的 Grok 版本

xAI 于2024年4月12日发布 Grok-1.5 Vision,是 Grok 系列首个具备视觉理解能力的版本,可解析文档、图表、截图与照片,目前仅开放邀请测试。

2024年4月12日,马斯克旗下人工智能公司 xAI 发布 Grok-1.5 Vision(简称 Grok-1.5V),这是 Grok 系列模型首次具备视觉输入能力。根据 xAI 官方博客说明,Grok-1.5V 能够处理多样化的视觉信息,包括文档、图表、屏幕截图与普通照片,并可针对真实场景图片回答问题,甚至能将手绘或截图中的图表转换成可执行的代码。目前 Grok-1.5V 仅开放少数受邀用户测试,尚未对外公开发布,普通用户暂时无法通过 X(原 Twitter)平台的 Grok 功能使用这项视觉能力。

技术意义:Grok 补齐多模态的最后一块拼图

在此之前,Grok 系列(包括3月17日开源的 Grok-1 与3月29日发布、以长上下文为卖点的 Grok-1.5)都仅限文字输入输出,缺乏视觉理解能力,这使其在功能完整度上明显落后于 OpenAI 的 GPT-4V、谷歌的 Gemini 系列。Grok-1.5V 的推出,代表 xAI 正式跨入多模态赛道,补上文字模型长期缺乏的“看”的能力。值得注意的是,官方特别强调其对文档、图表与屏幕截图的解析能力,而不仅是识别照片内容,显示 xAI 有意瞄准商务办公与数据分析场景,而非单纯的图片问答娱乐应用。

与竞品比较:起步较晚但目标明确

相较于 GPT-4V(2023年即整合进 ChatGPT)与 Gemini 系列的多模态能力,Grok-1.5V 的发布时间明显较晚,且目前仅供受邀测试,尚无公开产品或 API 可供外部验证其真实表现。不过从官方展示的案例来看,Grok-1.5V 主打“将图表转换为可执行代码”的能力,这与其他视觉模型单纯描述图片内容的路线略有差异,显示 xAI 试图在办公文档理解与数据可视化这个较窄但实用的切入点上做出区隔,而非与 GPT-4V、Gemini 进行全面性的视觉理解对决。

业界反应:测试阶段,效能仍待验证

由于 Grok-1.5V 目前仅限邀请制的小范围测试,外界尚无法通过标准化评测来验证其真实能力,业界普遍持观望态度。多数讨论聚焦于 xAI 在不到一个月内(从纯文字的 Grok-1.5 到具备视觉能力的 Grok-1.5V)推进模型能力的速度,但也有评论指出,“受邀测试、未公开发布”的模式,使得这次发布更偏向技术路线图的宣示,而非实际可用的产品里程碑。

对管理者的意义

对管理者而言,这则新闻的重点不在于立即可用的工具,而在于一个明确的技术趋势:AI 读懂“屏幕截图、报表、图表”正逐渐成为各家模型的标配,未来把手机拍的现场照片、系统截图、手写报表直接丢给 AI 提问或转成数据,会越来越普及、越来越不需要额外开发。现阶段可以关注的是,当 Grok 或同类视觉模型正式对外开放后,是否能真正省去“人工誊写图表数据”这类重复性工作。

测验检核:验证你的理解
5 篇 · 答对 80% 通过,通过后计入学习履历 登录后即可测验
问 AI:这篇文章怎么用在我的管理上?
内容由 AI 根据本文辅助生成,仅供参考,请自行判断准确性。
下一讲・AI 管理编年史 Meta发布Llama 3:8B/70B开源模型上线五大云平台

相关文章

我们使用必要 Cookie 维持登录与语言设置,并记录使用行为以改善服务。你可以只保留必要项目。 隐私权政策