Описание
Проект BigDL, в частности его компонент BigDL-LLM (который сейчас переходит в IPEX-LLM), представляет собой мощную библиотеку, предназначенную для оптимизации производительности больших языковых моделей (LLM) на различных аппаратных платформах Intel, включая CPU и GPU. Она позволяет пользователям запускать LLM со значительно сниженной задержкой, используя передовые методы квантования, такие как INT4, FP4, INT8 и FP8. Эта оптимизация имеет решающее значение для эффективного развертывания сложных моделей ИИ на разнообразных аппаратных конфигурациях.
Основываясь на фундаментальных разработках таких библиотек, как llama.cpp, gptq, bitsandbytes и qlora, BigDL-LLM предоставляет надежную основу как для инференса, так и для дообучения LLM на базе PyTorch. Последние обновления подчеркивают расширенные возможности, включая прямую загрузку моделей из ModelScope, начальную поддержку INT2 для запуска больших моделей на GPU с ограниченной VRAM и интеграцию с Text-Generation-WebUI для графического пользовательского интерфейса. Библиотека также представляет Self-Speculative Decoding, который обеспечивает практическое ускорение задержки инференса на GPU и CPU Intel.
Для разработчиков и исследователей, сосредоточенных на настройке моделей, BigDL-LLM предлагает комплексную поддержку различных методов дообучения на GPU Intel, включая LoRA, QLoRA, DPO, QA-LoRA и ReLoRA. Это позволяет эффективно адаптировать предварительно обученные модели к конкретным задачам и наборам данных. Проект продемонстрировал впечатляющие скорости дообучения, например, обучение LLaMA2-7B менее чем за 30 минут на нескольких GPU Intel. Кроме того, он поддерживает прямую загрузку популярных форматов моделей, таких как GGUF, AWQ и GPTQ, а также интегрируется с vLLM для непрерывной пакетной обработки и FastChat для обслуживания.
Экосистема BigDL выходит за рамки LLM, охватывая библиотеки для распределенной аналитики данных и ИИ (Orca), прозрачного ускорения TensorFlow и PyTorch (Nano), глубокого обучения на Spark (DLlib), анализа временных рядов (Chronos), рекомендательных систем (Friesian) и безопасного ИИ (PPML). BigDL-LLM является ключевым компонентом для тех, кто хочет использовать мощь LLM на оборудовании Intel, предлагая гибкое и производительное решение для широкого спектра приложений ИИ.
Основные функции BigDL LLM
Оптимизированный инференс LLM на Intel XPU (CPU, GPU)
Поддержка квантования INT4, FP4, INT8, FP8
Инференс с низкой задержкой для моделей PyTorch
Создано на основе llama.cpp, gptq, bitsandbytes, qlora
Прямая загрузка моделей GGUF, AWQ, GPTQ
Комплексное дообучение LLM на GPU Intel (LoRA, QLoRA, DPO, QA-LoRA, ReLoRA)
Self-Speculative Decoding для ускорения ~30%
Поддержка непрерывной пакетной обработки vLLM
Обслуживание через FastChat на CPU и GPU Intel
Прямая загрузка из ModelScope
Начальная поддержка INT2 для больших LLM на GPU с 16 ГБ VRAM
Интеграция с Text-Generation-WebUI
Начало работы с BigDL LLM
Установите BigDL-LLM через pip: `pip install --pre --upgrade bigdl-llm[all]` для CPU или `bigdl-llm[xpu]` для GPU.
Загрузите модели Hugging Face Transformers с оптимизацией INT4, используя `AutoModelForCausalLM.from_pretrained`.
Запустите оптимизированные модели на CPU Intel, указав путь к модели.
Запустите оптимизированные модели на GPU Intel, переместив модель и входные тензоры на устройство 'xpu'.
Настройте параметры дообучения для LoRA, QLoRA, DPO, QA-LoRA или ReLoRA.
Используйте FastChat или vLLM для обслуживания оптимизированных LLM.
Интегрируйте с LangChain для разработки приложений на основе LLM.
Варианты использования BigDL LLM
- Инференс LLM с низкой задержкой
- Дообучение LLM
- Эффективное развертывание моделей
- Разработка приложений ИИ
- Обучение больших моделей на ограниченной VRAM
- Ускоренная генерация текста





