跳转到主要内容
ToolPotion

bigscience/bloom

精选

BLOOM 是由 BigScience 开发的多语言自回归大型语言模型。它能够生成 46 种语言和 13 种编程语言的连贯文本,支持自然语言处理和研究的多种应用。

访问URL

描述

BLOOM 是由 BigScience 开发的自回归大型语言模型(LLM),旨在通过开源和开放科学推动和普及人工智能。该模型于 2022 年 7 月 11 日发布,能够在 46 种自然语言和 13 种编程语言中生成连贯文本,使其成为自然语言处理领域多种应用的多功能工具。

BLOOM 的架构基于变换器模型,经过 Megatron-LM GPT2 的修改。它具有 1760 亿个参数,70 层和 112 个注意力头,使其能够有效地处理和生成文本。该模型在一个包含 1.6TB 预处理文本的大型数据集上进行训练,其中包括 3500 亿个独特的标记。这种广泛的训练使 BLOOM 能够执行文本生成任务,包括信息提取、问答和摘要,即使对于未明确训练的任务也能表现良好。

BLOOM 旨在为大型语言模型的公共研究提供便利,使研究人员、教育工作者和开发者都能轻松访问。它可以通过 Hugging Face 的生态系统轻松集成到应用程序中,需安装 transformers 和 accelerate。该模型的目标用户包括公众、研究人员、学生和工程师等。然而,重要的是要注意,该模型不应在高风险环境或关键决策中使用,因为它可能生成看似真实但实际上不正确的输出。

BLOOM 的训练是在 Jean Zay 公共超级计算机上进行的,使用了 384 个 A100 80GB GPU,并由法国政府资助。通过使用核能来减轻训练过程的环境影响,产生的热量被重新用于校园住房。总体而言,BLOOM 代表了人工智能领域的一次重大进步,为语言生成和研究提供了强大的工具。

bigscience/bloom亮点

  • 模型类型:基于变换器的语言模型

  • 参数:176B

  • 支持的语言:46 种自然语言,13 种编程语言

  • 许可证:RAIL 许可证 v1.0

  • 发布日期:2022 年 7 月 11 日

  • 训练数据大小:1.6TB

  • 训练标记:350B 个独特标记

  • 计算基础设施:Jean Zay 公共超级计算机

bigscience/bloom入门

  1. 访问页面:访问 Hugging Face 网站以获取 BLOOM。

  2. 加载模型:使用 Hugging Face 的 transformers 库下载 BLOOM 模型。

  3. 配置环境:确保在您的环境中安装了 transformers 和 accelerate。

  4. 集成:根据需要使用该模型进行文本生成任务。

  5. 微调:可选地对模型进行特定应用的微调。

bigscience/bloom的使用案例

  • 文本生成
  • 信息提取
  • 问答
  • 摘要
  • 语言研究

bigscience/bloom的常见问题

bigscience/bloom 评价

加载中...

与 bigscience/bloom 类似的热门AI工具

Mistral-7B-v0.1 是一个具有 70 亿参数的预训练生成文本模型,旨在通过开源推动人工智能的发展。它在各种基准测试中超越了 Llama 2 13B,使其成为自然语言处理任务的强大工具。

精选AI 模型与大语言模型

AI 模型

DistilGPT2 是一个经过蒸馏的、以英语为基础的文本生成模型,源自 GPT-2。它提供了比其前代产品更快、更轻量级的替代方案,适用于各种创意和辅助写作任务。该模型经过预训练,可通过 Hugging Face 进行集成。

精选AI 模型与大语言模型

AI Hugging Face

GPT-2 是一个预训练的变换器模型,旨在生成英语文本。它利用因果语言建模目标,能够根据提示生成连贯的文本,使其在各种自然语言处理任务中非常有用。

精选AI 模型与大语言模型

DeepSeek-V3 是一个具有 6710 亿参数的专家混合语言模型,旨在实现高效推理和经济实惠的训练。它在各种基准测试中表现出色,展示了在自然语言处理任务中的强大性能。

精选AI 模型与大语言模型

BigBird基础模型是一个Transformer模型,它通过块稀疏注意力机制扩展了BERT,能够处理更长的序列。该模型已针对英文文本进行掩码语言模型任务的预训练,可以高效处理长达4096个token的序列,并在长文档任务上取得了最先进的成果。

AI 模型与大语言模型

DeepSeek-V4-Pro是一个先进的AI模型,旨在实现高效的百万标记上下文智能。它具有混合注意力架构,并在超过32万亿个标记上进行了预训练,适用于复杂推理任务和编码基准。

精选AI 模型与大语言模型

Mixtral-8x7B-Instruct-v0.1 是一个预训练的生成稀疏专家混合模型,旨在用于高级人工智能应用。它在各种基准测试中优于 Llama 2 70B,为自然语言处理中的微调和推理任务提供了强大的解决方案。

精选AI 模型与大语言模型

Llama-3.1-8B-Instruct 是由 Meta 开发的多语言大型语言模型,针对基于指令的任务进行了优化。它旨在商业和研究应用中提供自然语言理解和生成的高级能力。

精选AI 模型与大语言模型