Pular para o conteúdo principal
ToolPotion

BigDL LLM

BigDL-LLM é uma biblioteca de código aberto para executar modelos de linguagem grandes (LLMs) em hardware Intel XPU, de laptops a GPUs na nuvem. Ela suporta quantização INT4/FP4/INT8/FP8 para inferência de baixa latência e oferece capacidades abrangentes de finetuning para modelos PyTorch.

Visitar URL

Descrição

O Projeto BigDL, especificamente seu componente BigDL-LLM (agora em transição para IPEX-LLM), é uma biblioteca poderosa projetada para otimizar o desempenho de modelos de linguagem grandes (LLMs) em uma variedade de hardware Intel, incluindo CPUs e GPUs. Ela permite que os usuários executem LLMs com latência significativamente reduzida, aproveitando técnicas avançadas de quantização como INT4, FP4, INT8 e FP8. Essa otimização é crucial para implantar modelos de IA complexos de forma eficiente em diversas configurações de hardware.

Construído sobre o trabalho fundamental de bibliotecas como llama.cpp, gptq, bitsandbytes e qlora, o BigDL-LLM fornece um framework robusto tanto para inferência quanto para finetuning de LLMs baseados em PyTorch. Atualizações recentes destacam capacidades expandidas, incluindo carregamento direto de modelos do ModelScope, suporte inicial a INT2 para executar modelos grandes em GPUs com VRAM limitada e integração com Text-Generation-WebUI para uma experiência de usuário gráfica. A biblioteca também introduz Self-Speculative Decoding, que oferece um aumento prático de velocidade para a latência de inferência em GPUs e CPUs Intel.

Para desenvolvedores e pesquisadores focados na personalização de modelos, o BigDL-LLM oferece suporte abrangente para vários métodos de finetuning em GPUs Intel, incluindo LoRA, QLoRA, DPO, QA-LoRA e ReLoRA. Isso permite a adaptação eficiente de modelos pré-treinados para tarefas e conjuntos de dados específicos. O projeto demonstrou velocidades de finetuning impressionantes, como o treinamento de LLaMA2-7B em menos de 30 minutos em múltiplas GPUs Intel. Além disso, ele suporta o carregamento direto de formatos de modelo populares como GGUF, AWQ e GPTQ, e se integra com vLLM para batching contínuo e FastChat para serving.

O ecossistema BigDL se estende além dos LLMs, abrangendo bibliotecas para análise de dados distribuída e IA (Orca), aceleração transparente de TensorFlow e PyTorch (Nano), deep learning no Spark (DLlib), análise de séries temporais (Chronos), sistemas de recomendação (Friesian) e IA segura (PPML). O BigDL-LLM é um componente chave para aqueles que buscam alavancar o poder dos LLMs em hardware Intel, oferecendo uma solução flexível e performática para uma ampla gama de aplicações de IA.

Recursos principais de BigDL LLM

  • Inferência de LLM otimizada em Intel XPU (CPU, GPU)

  • Suporta quantização INT4, FP4, INT8, FP8

  • Inferência de baixa latência para modelos PyTorch

  • Construído sobre llama.cpp, gptq, bitsandbytes, qlora

  • Carregamento direto de modelos GGUF, AWQ, GPTQ

  • Finetuning abrangente de LLM em GPU Intel (LoRA, QLoRA, DPO, QA-LoRA, ReLoRA)

  • Self-Speculative Decoding para ~30% de aceleração

  • Suporta batching contínuo do vLLM

  • Serving FastChat em CPU e GPU Intel

  • Carregamento direto do ModelScope

  • Suporte inicial a INT2 para LLMs grandes em GPUs com 16GB de VRAM

  • Integração com Text-Generation-WebUI

Primeiros passos com BigDL LLM

  1. Instale o BigDL-LLM via pip: `pip install --pre --upgrade bigdl-llm[all]` para CPU ou `bigdl-llm[xpu]` para GPU.

  2. Carregue modelos Hugging Face Transformers com otimizações INT4 usando `AutoModelForCausalLM.from_pretrained`.

  3. Execute modelos otimizados em CPU Intel especificando o caminho do modelo.

  4. Execute modelos otimizados em GPU Intel movendo o modelo e os tensores de entrada para o dispositivo 'xpu'.

  5. Configure parâmetros de finetuning para LoRA, QLoRA, DPO, QA-LoRA ou ReLoRA.

  6. Utilize FastChat ou vLLM para servir LLMs otimizados.

  7. Integre com LangChain para desenvolvimento de aplicações LLM.

Casos de uso de BigDL LLM

  • Inferência de LLM de baixa latência
  • Finetuning de LLM
  • Implantação Eficiente de Modelos
  • Desenvolvimento de Aplicações de IA
  • Treinamento de Modelos Grandes com VRAM Limitada
  • Geração de Texto Acelerada

Perguntas frequentes de BigDL LLM

Avaliações de BigDL LLM

Carregando...

Ferramentas de IA populares como BigDL LLM

LiteRT é o framework de machine learning on-device de alto desempenho do Google para implantação de modelos GenAI e ML em plataformas de edge. Ele oferece conversão, runtime e…

MLOps e implantação de modelos

Intel® Neural Compressor é uma biblioteca Python de código aberto que oferece técnicas populares de compressão de modelos para PyTorch, TensorFlow e JAX. Ela suporta quantização…

Plataformas de machine learning

Apps de IA

vLLM é um mecanismo de inferência e serviço de alto rendimento e eficiência de memória para Modelos de Linguagem de Grande Escala (LLMs). Ele permite uma implantação mais rápida…

MLOps e implantação de modelos

Frameworks de IA

OpenVINO é um toolkit de código aberto para implementar soluções de IA de alto desempenho em hardware diverso. Ele permite que os desenvolvedores convertam, otimizem e executem…

MLOps e implantação de modelos

Plataformas de IA

Uma plataforma de infraestrutura de IA para desenvolvedores implantarem, ajustarem e executarem mais de 200 LLMs e modelos multimodais otimizados através de uma API compatível com…

DestaqueMLOps e implantação de modelos

vllm-project/vllm é um motor de inferência e serviço de alto desempenho e eficiente em memória, projetado para grandes modelos de linguagem (LLMs). Ele otimiza o desempenho…

DestaqueMLOps e implantação de modelos

Bento é uma plataforma de inferência projetada para velocidade e controle, permitindo que você implante qualquer modelo de IA em qualquer lugar. Oferece otimização personalizada,…

DestaqueMLOps e implantação de modelos

Frameworks de IA

ONNX Runtime é um framework de aprendizado de máquina acelerado e multiplataforma que otimiza o treinamento e a inferência. Ele suporta várias linguagens de programação e…

DestaquePlataformas de machine learning