Saltar al contenido principal
ToolPotion

BigDL LLM

BigDL-LLM es una biblioteca de código abierto para ejecutar modelos de lenguaje grandes (LLM) en hardware Intel XPU, desde portátiles hasta GPUs en la nube. Soporta cuantización INT4/FP4/INT8/FP8 para inferencia de baja latencia y ofrece capacidades integrales de ajuste fino para modelos PyTorch.

Visitar URL

Descripción

El Proyecto BigDL, específicamente su componente BigDL-LLM (que ahora está en transición a IPEX-LLM), es una potente biblioteca diseñada para optimizar el rendimiento de los modelos de lenguaje grandes (LLM) en una gama de hardware Intel, incluyendo CPUs y GPUs. Permite a los usuarios ejecutar LLM con una latencia significativamente reducida aprovechando técnicas avanzadas de cuantización como INT4, FP4, INT8 y FP8. Esta optimización es crucial para desplegar modelos de IA complejos de manera eficiente en diversas configuraciones de hardware.

Construido sobre el trabajo fundamental de bibliotecas como llama.cpp, gptq, bitsandbytes y qlora, BigDL-LLM proporciona un marco robusto tanto para la inferencia como para el ajuste fino de LLM basados en PyTorch. Las actualizaciones recientes destacan capacidades ampliadas, incluyendo la carga directa de modelos desde ModelScope, soporte inicial de INT2 para ejecutar modelos grandes en GPUs con VRAM limitada, e integración con Text-Generation-WebUI para una experiencia de usuario gráfica. La biblioteca también introduce Self-Speculative Decoding, que ofrece una mejora práctica en la latencia de inferencia en GPUs y CPUs Intel.

Para desarrolladores e investigadores centrados en la personalización de modelos, BigDL-LLM ofrece soporte integral para varios métodos de ajuste fino en GPUs Intel, incluyendo LoRA, QLoRA, DPO, QA-LoRA y ReLoRA. Esto permite la adaptación eficiente de modelos pre-entrenados a tareas y conjuntos de datos específicos. El proyecto ha demostrado velocidades de ajuste fino impresionantes, como el entrenamiento de LLaMA2-7B en menos de 30 minutos en múltiples GPUs Intel. Además, soporta la carga directa de formatos de modelo populares como GGUF, AWQ y GPTQ, y se integra con vLLM para la agrupación continua y FastChat para el servicio.

El ecosistema BigDL se extiende más allá de los LLM, abarcando bibliotecas para análisis de datos distribuidos e IA (Orca), aceleración transparente de TensorFlow y PyTorch (Nano), aprendizaje profundo en Spark (DLlib), análisis de series temporales (Chronos), sistemas de recomendación (Friesian) e IA segura (PPML). BigDL-LLM es un componente clave para aquellos que buscan aprovechar el poder de los LLM en hardware Intel, ofreciendo una solución flexible y de alto rendimiento para una amplia gama de aplicaciones de IA.

Características principales de BigDL LLM

  • Inferencia de LLM optimizada en Intel XPU (CPU, GPU)

  • Soporta cuantización INT4, FP4, INT8, FP8

  • Inferencia de baja latencia para modelos PyTorch

  • Construido sobre llama.cpp, gptq, bitsandbytes, qlora

  • Carga directa de modelos GGUF, AWQ, GPTQ

  • Ajuste fino integral de LLM en GPU Intel (LoRA, QLoRA, DPO, QA-LoRA, ReLoRA)

  • Self-Speculative Decoding para ~30% de mejora de velocidad

  • Soporta agrupación continua de vLLM

  • Servicio FastChat en CPU y GPU Intel

  • Carga directa desde ModelScope

  • Soporte inicial de INT2 para LLM grandes en GPUs con 16GB de VRAM

  • Integración con Text-Generation-WebUI

Primeros pasos con BigDL LLM

  1. Instalar BigDL-LLM vía pip: `pip install --pre --upgrade bigdl-llm[all]` para CPU o `bigdl-llm[xpu]` para GPU.

  2. Cargar modelos Hugging Face Transformers con optimizaciones INT4 usando `AutoModelForCausalLM.from_pretrained`.

  3. Ejecutar modelos optimizados en CPU Intel especificando la ruta del modelo.

  4. Ejecutar modelos optimizados en GPU Intel moviendo el modelo y los tensores de entrada al dispositivo 'xpu'.

  5. Configurar parámetros de ajuste fino para LoRA, QLoRA, DPO, QA-LoRA o ReLoRA.

  6. Utilizar FastChat o vLLM para servir LLM optimizados.

  7. Integrar con LangChain para el desarrollo de aplicaciones LLM.

Casos de uso de BigDL LLM

  • Inferencia de LLM de baja latencia
  • Ajuste fino de LLM
  • Despliegue eficiente de modelos
  • Desarrollo de aplicaciones de IA
  • Entrenamiento de modelos grandes con VRAM limitada
  • Generación de texto acelerada

Preguntas frecuentes de BigDL LLM

Reseñas de BigDL LLM

Cargando...

Herramientas de IA populares como BigDL LLM

LiteRT es el marco de aprendizaje automático de alto rendimiento de Google para el despliegue de modelos GenAI y ML en plataformas de borde. Ofrece conversión, tiempo de ejecución…

MLOps y despliegue de modelos

Intel® Neural Compressor es una biblioteca Python de código abierto que ofrece técnicas populares de compresión de modelos para PyTorch, TensorFlow y JAX. Admite cuantización…

Plataformas de aprendizaje automático

Apps de IA

vLLM es un motor de inferencia y servicio de alto rendimiento y eficiente en memoria para Modelos de Lenguaje Grande (LLMs). Permite un despliegue más rápido de modelos de IA con…

MLOps y despliegue de modelos

Frameworks de IA

OpenVINO es un kit de herramientas de código abierto para implementar soluciones de IA de alto rendimiento en diversos hardware. Permite a los desarrolladores convertir, optimizar…

MLOps y despliegue de modelos

Plataformas de IA

Una plataforma de infraestructura de IA para que los desarrolladores implementen, ajusten y ejecuten más de 200 LLMs y modelos multimodales optimizados a través de una API…

DestacadaMLOps y despliegue de modelos

vllm-project/vllm es un motor de inferencia y servicio de alto rendimiento y eficiente en memoria diseñado para grandes modelos de lenguaje (LLMs). Optimiza el rendimiento…

DestacadaMLOps y despliegue de modelos

Bento es una plataforma de inferencia diseñada para velocidad y control, que le permite desplegar cualquier modelo de IA en cualquier lugar. Ofrece optimización a medida, escalado…

DestacadaMLOps y despliegue de modelos

Frameworks de IA

ONNX Runtime es un marco de aprendizaje automático acelerado y multiplataforma que optimiza el entrenamiento y la inferencia. Soporta varios lenguajes de programación y…

DestacadaPlataformas de aprendizaje automático