Descrição
O Projeto BigDL, especificamente seu componente BigDL-LLM (agora em transição para IPEX-LLM), é uma biblioteca poderosa projetada para otimizar o desempenho de modelos de linguagem grandes (LLMs) em uma variedade de hardware Intel, incluindo CPUs e GPUs. Ela permite que os usuários executem LLMs com latência significativamente reduzida, aproveitando técnicas avançadas de quantização como INT4, FP4, INT8 e FP8. Essa otimização é crucial para implantar modelos de IA complexos de forma eficiente em diversas configurações de hardware.
Construído sobre o trabalho fundamental de bibliotecas como llama.cpp, gptq, bitsandbytes e qlora, o BigDL-LLM fornece um framework robusto tanto para inferência quanto para finetuning de LLMs baseados em PyTorch. Atualizações recentes destacam capacidades expandidas, incluindo carregamento direto de modelos do ModelScope, suporte inicial a INT2 para executar modelos grandes em GPUs com VRAM limitada e integração com Text-Generation-WebUI para uma experiência de usuário gráfica. A biblioteca também introduz Self-Speculative Decoding, que oferece um aumento prático de velocidade para a latência de inferência em GPUs e CPUs Intel.
Para desenvolvedores e pesquisadores focados na personalização de modelos, o BigDL-LLM oferece suporte abrangente para vários métodos de finetuning em GPUs Intel, incluindo LoRA, QLoRA, DPO, QA-LoRA e ReLoRA. Isso permite a adaptação eficiente de modelos pré-treinados para tarefas e conjuntos de dados específicos. O projeto demonstrou velocidades de finetuning impressionantes, como o treinamento de LLaMA2-7B em menos de 30 minutos em múltiplas GPUs Intel. Além disso, ele suporta o carregamento direto de formatos de modelo populares como GGUF, AWQ e GPTQ, e se integra com vLLM para batching contínuo e FastChat para serving.
O ecossistema BigDL se estende além dos LLMs, abrangendo bibliotecas para análise de dados distribuída e IA (Orca), aceleração transparente de TensorFlow e PyTorch (Nano), deep learning no Spark (DLlib), análise de séries temporais (Chronos), sistemas de recomendação (Friesian) e IA segura (PPML). O BigDL-LLM é um componente chave para aqueles que buscam alavancar o poder dos LLMs em hardware Intel, oferecendo uma solução flexível e performática para uma ampla gama de aplicações de IA.
Recursos principais de BigDL LLM
Inferência de LLM otimizada em Intel XPU (CPU, GPU)
Suporta quantização INT4, FP4, INT8, FP8
Inferência de baixa latência para modelos PyTorch
Construído sobre llama.cpp, gptq, bitsandbytes, qlora
Carregamento direto de modelos GGUF, AWQ, GPTQ
Finetuning abrangente de LLM em GPU Intel (LoRA, QLoRA, DPO, QA-LoRA, ReLoRA)
Self-Speculative Decoding para ~30% de aceleração
Suporta batching contínuo do vLLM
Serving FastChat em CPU e GPU Intel
Carregamento direto do ModelScope
Suporte inicial a INT2 para LLMs grandes em GPUs com 16GB de VRAM
Integração com Text-Generation-WebUI
Primeiros passos com BigDL LLM
Instale o BigDL-LLM via pip: `pip install --pre --upgrade bigdl-llm[all]` para CPU ou `bigdl-llm[xpu]` para GPU.
Carregue modelos Hugging Face Transformers com otimizações INT4 usando `AutoModelForCausalLM.from_pretrained`.
Execute modelos otimizados em CPU Intel especificando o caminho do modelo.
Execute modelos otimizados em GPU Intel movendo o modelo e os tensores de entrada para o dispositivo 'xpu'.
Configure parâmetros de finetuning para LoRA, QLoRA, DPO, QA-LoRA ou ReLoRA.
Utilize FastChat ou vLLM para servir LLMs otimizados.
Integre com LangChain para desenvolvimento de aplicações LLM.
Casos de uso de BigDL LLM
- Inferência de LLM de baixa latência
- Finetuning de LLM
- Implantação Eficiente de Modelos
- Desenvolvimento de Aplicações de IA
- Treinamento de Modelos Grandes com VRAM Limitada
- Geração de Texto Acelerada





