专栏 AI 管理编年史 第 64/217 讲 查看课程目录

Meta 发布 Llama 3.2:首款具备视觉能力的开源模型登场

25/09/2024 198
3:43
Meta 发布 Llama 3.2:首款具备视觉能力的开源模型登场

Meta 在 Meta Connect 2024 大会上由首席执行官 Mark Zuckerberg 亲自发布 Llama 3.2,首次推出具备图像理解能力的 11B 与 90B 视觉模型,并同步发布可运行在手机、边缘设备上的 1B、3B 轻量纯文本模型。

2024 年 9 月 25 日,Meta 在年度开发者大会 Meta Connect 2024 上,由首席执行官 Mark Zuckerberg 亲自发布最新一代开源模型 Llama 3.2。此次发布最受关注的重点,是 Llama 系列首次出现具备“视觉能力”的版本——11B 与 90B 两款中大型视觉语言模型,能够理解并回答关于图片内容的问题。同时,Meta 也发布了两款专为手机与边缘设备设计的轻量纯文本模型:1B 与 3B 参数版本,面向设备端运算与低延迟应用场景。

技术意义:不是重新训练模型,而是“加装”视觉能力

值得注意的是,Meta 并未为了加入图像理解而从零打造全新模型架构。11B 与 90B 版本是在原有的 Llama 3.1 纯文本模型基础上,额外训练并加入“视觉适配层”(adapter weights),把图像编码器的输出接入语言模型的推理流程。这种做法让 Meta 能够保留原本纯文本模型的语言能力,同时以相对较低的训练成本叠加视觉理解,而不必从头训练一个多模态大模型。对开发者而言,这也意味着未来的视觉能力有机会以“插件式”方式持续迭代,而不必每次都等待整个模型代际更新。

与前代及市场的比较

在此之前,Llama 3 与 3.1 系列都仅支持纯文本输入输出,若要处理图片,开发者需要自行接入第三方视觉模型或云端 API。Llama 3.2 的推出,意味着 Meta 首次在开源阵营中补齐了“看得懂图片”这块拼图,与 OpenAI、Google 等厂商的多模态模型站到了同一能力量级的竞技场。另一方面,1B、3B 这两款轻量模型面向手机与边缘设备离线运算,体现出 Meta 对“AI 不必事事上云”这条路线的持续投入,与同期业界推出的小型高效模型(如 Gemma 2、GPT-4o mini)方向一致,都在争夺“设备端 AI”这一新战场。

业界关注焦点

开发者社群对此次发布的讨论,多集中在授权条款与商用限制是否会随模型能力扩大而收紧,以及视觉版本的实际识别准确度能否达到可商用门槛。由于 Llama 系列长期是企业自建 AI 系统时最常见的开源选择之一,此次是否维持开放、可自行部署的特性,将直接影响已经围绕 Llama 生态系统搭建工具链的中小型技术团队。

对管理者的意义

对管理者而言,这则新闻的重点不在于技术细节,而在于“图片理解”这项能力正快速从云端大厂专属功能,变成可自行部署、成本可控的开源选项——这意味着门店巡检照片识别、商品陈列稽核、客服上传图片分类等场景,未来有机会用内部自建系统处理,而不必完全依赖外部 AI 服务的按次计费。

测验检核:验证你的理解
5 篇 · 答对 80% 通过,通过后计入学习履历 登录后即可测验
问 AI:这篇文章怎么用在我的管理上?
内容由 AI 根据本文辅助生成,仅供参考,请自行判断准确性。
下一讲・AI 管理编年史 OpenAI 发布 Canvas:ChatGPT 首次跳出聊天框,改用“并肩协作”界面写文案与写代码

相关文章

我们使用必要 Cookie 维持登录与语言设置,并记录使用行为以改善服务。你可以只保留必要项目。 隐私权政策