Перейти к основному содержимому
ToolPotion

BigDL LLM

BigDL-LLM — это библиотека с открытым исходным кодом для запуска больших языковых моделей (LLM) на оборудовании Intel XPU, от ноутбуков до облачных GPU. Она поддерживает квантование INT4/FP4/INT8/FP8 для инференса с низкой задержкой и предлагает комплексные возможности дообучения (finetuning) для моделей PyTorch.

Посетить URL

Описание

Проект BigDL, в частности его компонент BigDL-LLM (который сейчас переходит в IPEX-LLM), представляет собой мощную библиотеку, предназначенную для оптимизации производительности больших языковых моделей (LLM) на различных аппаратных платформах Intel, включая CPU и GPU. Она позволяет пользователям запускать LLM со значительно сниженной задержкой, используя передовые методы квантования, такие как INT4, FP4, INT8 и FP8. Эта оптимизация имеет решающее значение для эффективного развертывания сложных моделей ИИ на разнообразных аппаратных конфигурациях.

Основываясь на фундаментальных разработках таких библиотек, как llama.cpp, gptq, bitsandbytes и qlora, BigDL-LLM предоставляет надежную основу как для инференса, так и для дообучения LLM на базе PyTorch. Последние обновления подчеркивают расширенные возможности, включая прямую загрузку моделей из ModelScope, начальную поддержку INT2 для запуска больших моделей на GPU с ограниченной VRAM и интеграцию с Text-Generation-WebUI для графического пользовательского интерфейса. Библиотека также представляет Self-Speculative Decoding, который обеспечивает практическое ускорение задержки инференса на GPU и CPU Intel.

Для разработчиков и исследователей, сосредоточенных на настройке моделей, BigDL-LLM предлагает комплексную поддержку различных методов дообучения на GPU Intel, включая LoRA, QLoRA, DPO, QA-LoRA и ReLoRA. Это позволяет эффективно адаптировать предварительно обученные модели к конкретным задачам и наборам данных. Проект продемонстрировал впечатляющие скорости дообучения, например, обучение LLaMA2-7B менее чем за 30 минут на нескольких GPU Intel. Кроме того, он поддерживает прямую загрузку популярных форматов моделей, таких как GGUF, AWQ и GPTQ, а также интегрируется с vLLM для непрерывной пакетной обработки и FastChat для обслуживания.

Экосистема BigDL выходит за рамки LLM, охватывая библиотеки для распределенной аналитики данных и ИИ (Orca), прозрачного ускорения TensorFlow и PyTorch (Nano), глубокого обучения на Spark (DLlib), анализа временных рядов (Chronos), рекомендательных систем (Friesian) и безопасного ИИ (PPML). BigDL-LLM является ключевым компонентом для тех, кто хочет использовать мощь LLM на оборудовании Intel, предлагая гибкое и производительное решение для широкого спектра приложений ИИ.

Основные функции BigDL LLM

  • Оптимизированный инференс LLM на Intel XPU (CPU, GPU)

  • Поддержка квантования INT4, FP4, INT8, FP8

  • Инференс с низкой задержкой для моделей PyTorch

  • Создано на основе llama.cpp, gptq, bitsandbytes, qlora

  • Прямая загрузка моделей GGUF, AWQ, GPTQ

  • Комплексное дообучение LLM на GPU Intel (LoRA, QLoRA, DPO, QA-LoRA, ReLoRA)

  • Self-Speculative Decoding для ускорения ~30%

  • Поддержка непрерывной пакетной обработки vLLM

  • Обслуживание через FastChat на CPU и GPU Intel

  • Прямая загрузка из ModelScope

  • Начальная поддержка INT2 для больших LLM на GPU с 16 ГБ VRAM

  • Интеграция с Text-Generation-WebUI

Начало работы с BigDL LLM

  1. Установите BigDL-LLM через pip: `pip install --pre --upgrade bigdl-llm[all]` для CPU или `bigdl-llm[xpu]` для GPU.

  2. Загрузите модели Hugging Face Transformers с оптимизацией INT4, используя `AutoModelForCausalLM.from_pretrained`.

  3. Запустите оптимизированные модели на CPU Intel, указав путь к модели.

  4. Запустите оптимизированные модели на GPU Intel, переместив модель и входные тензоры на устройство 'xpu'.

  5. Настройте параметры дообучения для LoRA, QLoRA, DPO, QA-LoRA или ReLoRA.

  6. Используйте FastChat или vLLM для обслуживания оптимизированных LLM.

  7. Интегрируйте с LangChain для разработки приложений на основе LLM.

Варианты использования BigDL LLM

  • Инференс LLM с низкой задержкой
  • Дообучение LLM
  • Эффективное развертывание моделей
  • Разработка приложений ИИ
  • Обучение больших моделей на ограниченной VRAM
  • Ускоренная генерация текста

Часто задаваемые вопросы BigDL LLM

Отзывы о BigDL LLM

Загрузка...

Популярные ИИ-инструменты, похожие на BigDL LLM

LiteRT — это высокопроизводительный фреймворк Google для машинного обучения на устройстве, предназначенный для развертывания моделей GenAI и ML на периферийных платформах. Он…

MLOps и развёртывание моделей

AI-фреймворки

Intel® Neural Compressor — это библиотека Python с открытым исходным кодом, предлагающая популярные методы сжатия моделей для PyTorch, TensorFlow и JAX. Она поддерживает…

Платформы машинного обучения

AI-приложения

vLLM — это высокопроизводительный и экономичный по памяти движок для вывода и обслуживания больших языковых моделей (LLM). Он обеспечивает более быструю развертку AI-моделей с…

MLOps и развёртывание моделей

AI-фреймворки

OpenVINO — это набор инструментов с открытым исходным кодом для развертывания высокопроизводительных решений ИИ на разнообразном оборудовании. Он позволяет разработчикам…

MLOps и развёртывание моделей

AI-платформы

Платформа ИИ-инфраструктуры для разработчиков, позволяющая развертывать, настраивать и запускать более 200 оптимизированных LLM и мультимодальных моделей через один совместимый с…

РекомендованоMLOps и развёртывание моделей

vllm-project/vllm — это высокопроизводительный и экономичный по памяти движок вывода и обслуживания, разработанный для больших языковых моделей (LLM). Он оптимизирует…

РекомендованоMLOps и развёртывание моделей

Bento — это платформа для инференса, разработанная для скорости и контроля, позволяющая развертывать любую AI-модель где угодно. Она предлагает индивидуальную оптимизацию,…

РекомендованоMLOps и развёртывание моделей

AI-фреймворки

ONNX Runtime — это кроссплатформенный ускоренный фреймворк машинного обучения, который оптимизирует обучение и вывод. Он поддерживает различные языки программирования и платформы,…

РекомендованоПлатформы машинного обучения