Llama 2 采用一种慷慨的宽松式许可证,但禁止使用 Llama 来“改进其他任何大语言模型;Llama 2 除外”,如果产品的月活跃用户( MAU )超过 7 亿,用户必须申请特殊的商业许可证。
Meta 向商业 AI 领域迈出了试探性的第一步,发布了功能强大的新 Llama 2 大语言模型( LLM ),用户可以在本周下载,并将其整合到应用程序中。
Meta 的 Llama 2 用 2 万亿个 token 和逾 100 万个人类注释加以训练,采用定制许可证,可免费用于商业和研究用途,不像 Llama 的第一个版本只用于研究用途。
Meta 的 Llama 2 已经拿新混合的公开可用的数据加以训练,预训练语料库的规模要大40%,上下文长度是 Llama 的两倍,现发布 70 亿参数、130 亿参数和 700 亿参数三个版本。(由于缺乏足够的时间对模型进行红队或安全测试,Meta 还没有发布经过训练的 340 亿参数的版本。)
Meta 还发布了 Llama 2-Chat,这是一个针对对话用例进行优化的微调版本。它也有 70 亿参数、130 亿参数和 700 亿参数三个版本。
下载了 Llama 2 的用户将获得:
•模型代码
•模型权重
•README(用户指南)
•负责任使用指南
•许可证
•可接受使用政策
•模型卡
(尽管 Meta 将 Llama 2 描述为“开源”,但它并不是开源项目组织( OSI )批准的许可证。它是一种慷慨的宽松式许可证,但禁止使用 Llama 来“改进其他任何大语言模型,但 Llama 2 或其衍生品除外”,如果产品的月活跃用户在 2023 年 6 月超过了 7 亿,用户必须申请特殊的商业许可证,比如任何规模与 Telegram 相当的公司。)
模型可以下载用于组织自己的系统,也可以在 Azure 和 AWS 上访问——前者通过 Azure AI 模型目录,后者通过亚马逊 SageMaker JumpStart 机器学习中心。
训练 Llama2-Chat:“这个过程从使用公开可用的在线资源对 Llama 2 进行预训练开始。在此之后,我们通过运用监督式微调创建了 Llama 2-Chat 的初始版本。随后以迭代方式不断改进模型,使用带有人类反馈的强化学习( RLHF )方法,具体是通过拒绝采样和近端策略优化( PPO )。在整个 RLHF 阶段,与模型增强并行的迭代奖励建模数据的积累对于确保奖励模型保持在分布范围内至关重要。”
Meta Llama-2 的更多细节
Meta 将 Llama 2 描述为一种使用经过优化的 transformer 架构的自动回归语言模型。
该公司特别指出,经过调优的版本使用监督式微调( SFT )和带有人类反馈的强化学习( RLHF ),从而“与人类对帮助和安全的偏好保持对齐”。
这里有一篇技术上更详细的 76 页论文。
论文特别指出,Llama 2 团队“从 Touvron 等人描述的预训练方法开始,使用经过优化的自动回归 transformer,但是……执行了更强大的数据清洗,更新了我们的数据混合,用总数多出 40% 的 token 加以训练,上下文长度增加了一倍,并使用分组查询注意力( GQA )为我们的更大模型提高推理可扩展性……”
Meta 在其研究超级集群( RSC )和内部生产集群上对 Llama 2 模型进行了预训练。两个集群都使用英伟达 A100。
两者有一些不同之处,包括互连方面的不同。
“RSC 使用英伟达 Quantum InfiniBand,而我们的生产集群配备了基于商用以太网交换机的 RoCE (基于融合以太网的 RDMA)解决方案。这两种解决方案都将 200 Gbps 端点互连起来。第二个区别是每块 GPU 的功耗上限——RSC 使用 400W,而我们的生产集群使用 350W。通过这种双集群设置,我们能够比较这些不同类型的互连针对大规模训练的适用性。”
Meta 表示,训练的总排放量估计为 539 吨二氧化碳当量( 539 tCO2eq),并补充道:“其中 100% 被 Meta 的可持续发展计划所抵消了。”
Meta 的 AI 战略是什么?
Meta 计划今年斥资 330 亿美元来支持“持续打造 AI 能力的工作”,首席财务官 Susan Li 在 4月份的第一季度财报电话会议上表示。Mark Zuckerberg 在同一场电话会议上告诉分析师:“眼下,大多数在训练大语言模型的公司其商业模式导致它们采用封闭的开发方法。”
“我认为这个行业有一个重大的机会来帮助打造开放的生态系统。如果我们能帮助成为其中的一员,那么我想,这个行业的很多人都会统一使用这些开放工具,并帮助进一步改进它们。因此,这将使其他公司更容易与我们的产品和平台进行整合,因为我们支持更多的整合。这也将帮助我们的产品保持领先地位。”
Zuckerberg 在投资者电话会议的问答环节中补充道:“LLaMA 是一种我们只向研究人员提供的模型……我们在做大量工作,我认为我们渴望并希望开放性方面做得比这更到位。所以我们需要想办法做到这一点。”
Meta 在发布 LLaMA 第一个版本时指出:“与 DeepMind 的 Chinchilla、谷歌的 PaLM或 OpenAI 的 GPT-3 不同,我们只使用公开可用的数据,使我们开发的产品与开源兼容,而大多数现有模型依赖非公开可用或未正式记录的数据……”
被分析师问及未来是否会有类似 ChatGPT的 Meta AI API 用于商业集成时,Mark Zuckerberg说:“我更多地将其视为一种后端基础设施优势,在产品方面有望集成起来,但它应该能够使我们保持领先地位,更广泛地与社区进行集成,并使我们运行所有这些基础设施的方式逐渐变得更高效。”
https://www.thestack.technology/metas-llama-2-ai-is-free-a-bit-different/
https://www.reddit.com/r/LocalLLaMA/comments/153i6vi/no_llama_2_is_not_an_open_source_llm/
热门跟贴