Meta发布Llama 3:8B/70B开源模型上线五大云平台
Meta于4月18日发布新一代开源模型Llama 3,提供8B、70B两种规模,训练数据达15万亿token,并同步上线AWS、Google Cloud、Azure、Hugging Face、NVIDIA NIM五大平台,官方宣称多项基准测试表现领先业界。
Meta于2024年4月18日正式发布新一代开源大语言模型Llama 3,同步推出80亿参数(8B)与700亿参数(70B)两种规模,并各自提供“预训练版”与“指令微调版”(Instruct)供不同用途选用。根据Meta AI官方博客公告,Llama 3使用约15万亿token的训练数据,数据来源全部取自公开网络内容,训练规模较上一代Llama 2大幅提升。
官方宣称,Llama 3在多项业界标准基准测试(包括推理、代码编写、常识问答等评测集)上取得同量级模型中的领先成绩,并特别强调模型的推理能力与指令理解能力较前代有明显进步。与此同时,Meta也将Llama 3同步上架至AWS、Google Cloud、Microsoft Azure、Hugging Face与NVIDIA NIM等主要云端与开发平台,让全球开发者可以直接通过现有云账号获取、部署与微调模型。值得注意的是,Llama 3仍采用Meta自定的社区授权条款(Llama 3 Community License),开发者使用前须接受该授权,且月活跃用户超过7亿的企业需另向Meta申请授权,并非完全没有授权限制。
技术意义:开源阵营首次追平闭源模型水准
Llama 3的发布之所以受到高度关注,关键在于这是开源模型阵营首次在多项基准测试上宣称追平甚至超越同期部分闭源商用模型的表现。过去开源模型普遍被认为在推理与复杂指令遵循能力上落后于闭源模型,Llama 3的成绩等于向市场宣告“开源不等于次等”,也让企业在选择AI供应商时多了一个可自行部署、无需按token付费给第三方API的选项。
与前代对比:训练数据量大幅扩增
相较Llama 2的训练数据规模,Llama 3的15万亿token是明显的跳跃式增长,这也解释了为何官方特别强调推理能力的提升——更大量、更干净的公开数据,通常能让模型在语言理解与逻辑推演上有明显提升。不过Meta并未在本次公告中披露数据集的详细组成与质量筛选方式,市场对于“业界领先”的评测结果仍需持续观察第三方实测验证。
业界反应:五大平台同步上线,企业采用门槛降低
相较于过去许多开源模型发布后仍需经过数周才能在主要云平台部署,Llama 3选择在发布当天即同步登陆AWS、Google Cloud、Azure、Hugging Face、NVIDIA NIM,等于是把“发布”与“可用”画上等号。这对企业IT部门而言意义重大:不必等待内部团队自行搭建推理环境,即可通过现有云合约直接测试甚至上线,大幅缩短导入评估的时间成本。
对管理者而言,Llama 3的发布代表企业导入生成式AI的选项再度增加:除了向现有供应商按用量付费之外,现在也能考虑以开源模型自建内部工具(例如客服问答、内部知识库检索),换取数据留在企业内部、长期成本更可控的灵活性。若企业已有云端IT资源,不妨请技术团队先用8B版本做小规模概念验证,评估是否足以替代部分现有付费API使用场景。