描述
Meta AI 通过发布 OPT-175B(一个在公开可用数据集上训练的 1750 亿参数模型)来普及大规模语言模型的访问。这项举措旨在促进更广泛的社区参与,以理解基础性新人工智能技术,打破以往仅限于资源雄厚实验室的有限访问模式。通过提供预训练模型和必要的训练代码,OPT-175B 使全球的学术研究人员、公民社会、政策制定者和行业研究实验室能够进行可复现的研究并共同推进该领域。
此次发布以对开放科学和负责任的 AI 开发的承诺为基础。Meta AI 正在分享开发过程的详细文档,包括日常训练、计算使用和人力开销的完整日志。这种透明度使其他研究人员能够在此基础上进行工作,并使用共享模型上的可量化指标来分析潜在的危害。OPT-175B 使用 Meta 的开源 Fully Sharded Data Parallel (FSDP) API 和 NVIDIA 在 Megatron-LM 中的张量并行抽象进行训练,实现了显著的能源效率,碳足迹仅为 GPT-3 的 1/7。
除了 OPT-175B,Meta AI 还发布了一系列规模较小的基线模型,这些模型在相同数据上使用相似的设置进行训练,以促进对规模效应的研究。这些模型包括参数量从 1.25 亿到 300 亿不等的模型。此次发布受非商业许可的约束,优先考虑研究用例,并旨在防止滥用。通过增加参与定义伦理考量声音的多样性,Meta AI 希望推动负责任的 AI 开发进展,并为大型语言模型建立明确的指导方针。
这种开放的合作对于人工智能研究的进步至关重要,它使科学界能够探索前沿模型的潜力,同时探测其脆弱性。OPT-175B 及其相关资源的发布旨在将更多视角带到大型语言模型创建的前沿,协助设计负责任的发布策略,并为该领域带来前所未有的透明度。
OPT-175B亮点
1750 亿参数
在公开可用数据集上训练
包含预训练模型和训练代码
用于研究的非商业许可
授予学术研究人员及相关组织访问权限
详细的开发过程文档
训练过程完整日志
用于危害分析的可量化指标
高能效训练方法
发布了一系列规模较小的基线模型
促进可复现的研究
推动负责任的 AI 开发
增强 LLM 开发的透明度
OPT-175B入门
申请访问:提交 OPT-175B 的访问申请。
下载代码:访问用于训练和部署的开源代码。
获取模型:下载规模较小的基线模型。
设置环境:使用必要的库准备您的研究环境。
集成模型:加载并利用 OPT-175B 模型进行研究任务。
分析结果:进行实验并分析模型行为和输出。
贡献研究:分享发现并为更广泛的 AI 社区做出贡献。
OPT-175B的使用案例
- NLP 研究
- 偏见缓解
- 模型可解释性
- 负责任的 AI
- 可复现科学
- 文本生成
- AI 伦理







