Aller au contenu principal
ToolPotion

BigDL LLM

BigDL-LLM est une bibliothèque open-source pour exécuter de grands modèles de langage (LLM) sur du matériel Intel XPU, des ordinateurs portables aux GPU cloud. Elle prend en charge la quantification INT4/FP4/INT8/FP8 pour une inférence à faible latence et offre des capacités complètes de fine-tuning pour les modèles PyTorch.

Visiter l'URL

Description

Le projet BigDL, et plus particulièrement son composant BigDL-LLM (en transition vers IPEX-LLM), est une bibliothèque puissante conçue pour optimiser les performances des grands modèles de langage (LLM) sur une gamme de matériel Intel, y compris les CPU et les GPU. Elle permet aux utilisateurs d'exécuter des LLM avec une latence considérablement réduite en tirant parti de techniques de quantification avancées telles que INT4, FP4, INT8 et FP8. Cette optimisation est cruciale pour déployer efficacement des modèles d'IA complexes sur diverses configurations matérielles.

Basé sur le travail fondamental de bibliothèques comme llama.cpp, gptq, bitsandbytes et qlora, BigDL-LLM fournit un cadre robuste pour l'inférence et le fine-tuning des LLM basés sur PyTorch. Les mises à jour récentes mettent en évidence des capacités étendues, notamment le chargement direct de modèles depuis ModelScope, le support initial de INT2 pour exécuter de grands modèles sur des GPU avec une VRAM limitée, et l'intégration avec Text-Generation-WebUI pour une expérience utilisateur graphique. La bibliothèque introduit également le décodage auto-spéculatif (Self-Speculative Decoding), qui offre une accélération pratique de la latence d'inférence sur les GPU et CPU Intel.

Pour les développeurs et les chercheurs axés sur la personnalisation des modèles, BigDL-LLM offre un support complet pour diverses méthodes de fine-tuning sur les GPU Intel, y compris LoRA, QLoRA, DPO, QA-LoRA et ReLoRA. Cela permet une adaptation efficace des modèles pré-entraînés à des tâches et des ensembles de données spécifiques. Le projet a démontré des vitesses de fine-tuning impressionnantes, comme l'entraînement de LLaMA2-7B en moins de 30 minutes sur plusieurs GPU Intel. De plus, il prend en charge le chargement direct de formats de modèles populaires comme GGUF, AWQ et GPTQ, et s'intègre à vLLM pour le batching continu et à FastChat pour le service.

L'écosystème BigDL s'étend au-delà des LLM, englobant des bibliothèques pour l'analyse de données distribuée et l'IA (Orca), l'accélération transparente de TensorFlow et PyTorch (Nano), le deep learning sur Spark (DLlib), l'analyse de séries temporelles (Chronos), les systèmes de recommandation (Friesian) et l'IA sécurisée (PPML). BigDL-LLM est un composant clé pour ceux qui cherchent à exploiter la puissance des LLM sur le matériel Intel, offrant une solution flexible et performante pour un large éventail d'applications d'IA.

Fonctionnalités principales de BigDL LLM

  • Inférence LLM optimisée sur Intel XPU (CPU, GPU)

  • Prend en charge la quantification INT4, FP4, INT8, FP8

  • Inférence à faible latence pour les modèles PyTorch

  • Construit sur llama.cpp, gptq, bitsandbytes, qlora

  • Chargement direct des modèles GGUF, AWQ, GPTQ

  • Fine-tuning LLM complet sur GPU Intel (LoRA, QLoRA, DPO, QA-LoRA, ReLoRA)

  • Décodage auto-spéculatif pour un gain de vitesse d'environ 30%

  • Prend en charge le batching continu vLLM

  • Service FastChat sur CPU et GPU Intel

  • Chargement direct depuis ModelScope

  • Support initial INT2 pour les grands LLM sur GPU avec 16 Go de VRAM

  • Intégration avec Text-Generation-WebUI

Premiers pas avec BigDL LLM

  1. Installer BigDL-LLM via pip : `pip install --pre --upgrade bigdl-llm[all]` pour CPU ou `bigdl-llm[xpu]` pour GPU.

  2. Charger les modèles Hugging Face Transformers avec des optimisations INT4 en utilisant `AutoModelForCausalLM.from_pretrained`.

  3. Exécuter des modèles optimisés sur CPU Intel en spécifiant le chemin du modèle.

  4. Exécuter des modèles optimisés sur GPU Intel en déplaçant le modèle et les tenseurs d'entrée vers le périphérique 'xpu'.

  5. Configurer les paramètres de fine-tuning pour LoRA, QLoRA, DPO, QA-LoRA ou ReLoRA.

  6. Utiliser FastChat ou vLLM pour servir les LLM optimisés.

  7. Intégrer avec LangChain pour le développement d'applications LLM.

Cas d'utilisation de BigDL LLM

  • Inférence LLM à faible latence
  • Fine-tuning LLM
  • Déploiement efficace de modèles
  • Développement d'applications IA
  • Entraînement de grands modèles sur VRAM limitée
  • Génération de texte accélérée

FAQ de BigDL LLM

Avis sur BigDL LLM

Chargement...

Outils IA populaires comme BigDL LLM

LiteRT est le framework ML haute performance de Google pour le déploiement de modèles GenAI et ML sur des plateformes embarquées. Il offre une conversion, une exécution et une…

MLOps et déploiement de modèles

Intel® Neural Compressor est une bibliothèque Python open-source offrant des techniques populaires de compression de modèles pour PyTorch, TensorFlow et JAX. Elle prend en charge…

Plateformes de machine learning

Applications IA

vLLM est un moteur d'inférence et de service à haut débit et économe en mémoire pour les grands modèles de langage (LLMs). Il permet un déploiement plus rapide des modèles d'IA…

MLOps et déploiement de modèles

Frameworks IA

OpenVINO est une boîte à outils open-source pour déployer des solutions d'IA haute performance sur du matériel diversifié. Elle permet aux développeurs de convertir, d'optimiser…

MLOps et déploiement de modèles

Plateformes IA

Une plateforme d'infrastructure IA pour les développeurs afin de déployer, d'affiner et d'exécuter plus de 200 LLM optimisés et modèles multimodaux via une API compatible OpenAI…

En vedetteMLOps et déploiement de modèles

vllm-project/vllm est un moteur d'inférence et de service à haut débit et efficace en mémoire, conçu pour les grands modèles de langage (LLMs). Il optimise les performances tout…

En vedetteMLOps et déploiement de modèles

Bento est une plateforme d'inférence conçue pour la vitesse et le contrôle, vous permettant de déployer n'importe quel modèle d'IA n'importe où. Elle offre une optimisation sur…

En vedetteMLOps et déploiement de modèles

Frameworks IA

ONNX Runtime est un cadre d'apprentissage automatique accéléré multiplateforme qui optimise l'entraînement et l'inférence. Il prend en charge divers langages de programmation et…

En vedettePlateformes de machine learning