説明
BigDLプロジェクト、特にそのBigDL-LLMコンポーネント(現在はIPEX-LLMへ移行中)は、CPUやGPUを含む幅広いIntelハードウェア上で大規模言語モデル(LLM)のパフォーマンスを最適化するために設計された強力なライブラリです。INT4、FP4、INT8、FP8などの高度な量子化技術を活用することで、ユーザーは大幅に低減された遅延でLLMを実行できます。この最適化は、多様なハードウェア構成上で複雑なAIモデルを効率的にデプロイするために不可欠です。
llama.cpp、gptq、bitsandbytes、qloraなどのライブラリの基盤の上に構築されたBigDL-LLMは、PyTorchベースのLLMの推論とファインチューニングの両方に対して堅牢なフレームワークを提供します。最近のアップデートでは、ModelScopeからの直接モデルロード、VRAMが限られたGPU上での大規模モデル実行のための初期INT2サポート、グラフィカルユーザーエクスペリエンスのためのText-Generation-WebUIとの統合など、機能拡張が強調されています。このライブラリは、Intel GPUおよびCPU上での推論遅延を実質的に高速化するSelf-Speculative Decodingも導入しています。
モデルカスタマイズに注力する開発者や研究者向けに、BigDL-LLMはIntel GPU上でのLoRA、QLoRA、DPO、QA-LoRA、ReLoRAを含む様々なファインチューニングメソッドに対して包括的なサポートを提供します。これにより、事前学習済みモデルを特定のタスクやデータセットに効率的に適応させることができます。このプロジェクトは、複数のIntel GPU上でLLaMA2-7Bを30分未満でトレーニングするなど、印象的なファインチューニング速度を実証しています。さらに、GGUF、AWQ、GPTQなどの一般的なモデル形式の直接ロードをサポートし、連続バッチ処理のためのvLLMやサービングのためのFastChatと統合されています。
BigDLエコシステムはLLMを超えて拡張され、分散データ分析およびAI(Orca)、TensorFlowおよびPyTorchの透過的アクセラレーション(Nano)、Spark上のディープラーニング(DLlib)、時系列分析(Chronos)、レコメンデーションシステム(Friesian)、セキュアAI(PPML)のためのライブラリを含んでいます。BigDL-LLMは、Intelハードウェア上でLLMのパワーを活用したい人々にとって重要なコンポーネントであり、幅広いAIアプリケーションに対して柔軟で高性能なソリューションを提供します。
BigDL LLMの主要機能
Intel XPU(CPU、GPU)上での最適化されたLLM推論
INT4、FP4、INT8、FP8量子化をサポート
PyTorchモデル向けの低遅延推論
llama.cpp、gptq、bitsandbytes、qloraを基盤
GGUF、AWQ、GPTQモデルの直接ロード
Intel GPU上での包括的なLLMファインチューニング(LoRA、QLoRA、DPO、QA-LoRA、ReLoRA)
約30%の高速化を実現するSelf-Speculative Decoding
vLLMの連続バッチ処理をサポート
Intel CPUおよびGPU上でのFastChatサービング
ModelScopeからの直接ロード
16GB VRAM GPU上での大規模LLM実行のための初期INT2サポート
Text-Generation-WebUIとの統合
BigDL LLMをはじめる
pipでBigDL-LLMをインストールします。CPUの場合は`pip install --pre --upgrade bigdl-llm[all]`、GPUの場合は`bigdl-llm[xpu]`を使用します。
`AutoModelForCausalLM.from_pretrained`を使用して、INT4最適化でHugging Face Transformersモデルをロードします。
モデルパスを指定して、Intel CPU上で最適化されたモデルを実行します。
モデルと入力テンソルを'xpu'デバイスに移動して、Intel GPU上で最適化されたモデルを実行します。
LoRA、QLoRA、DPO、QA-LoRA、またはReLoRAのファインチューニングパラメータを設定します。
最適化されたLLMのサービングにFastChatまたはvLLMを利用します。
LLMアプリケーション開発のためにLangChainと統合します。
BigDL LLMの使用例
- 低遅延LLM推論
- LLMファインチューニング
- 効率的なモデルデプロイメント
- AIアプリケーション開発
- 限られたVRAMでの大規模モデルトレーニング
- 高速化されたテキスト生成





