メインコンテンツへスキップ
ToolPotion

BigDL LLM

BigDL-LLMは、ラップトップからクラウドGPUまで、Intel XPUハードウェア上で大規模言語モデル(LLM)を実行するためのオープンソースライブラリです。低遅延推論のためのINT4/FP4/INT8/FP8量子化をサポートし、PyTorchモデル向けの包括的なファインチューニング機能を提供します。

URLを訪問

説明

BigDLプロジェクト、特にそのBigDL-LLMコンポーネント(現在はIPEX-LLMへ移行中)は、CPUやGPUを含む幅広いIntelハードウェア上で大規模言語モデル(LLM)のパフォーマンスを最適化するために設計された強力なライブラリです。INT4、FP4、INT8、FP8などの高度な量子化技術を活用することで、ユーザーは大幅に低減された遅延でLLMを実行できます。この最適化は、多様なハードウェア構成上で複雑なAIモデルを効率的にデプロイするために不可欠です。

llama.cpp、gptq、bitsandbytes、qloraなどのライブラリの基盤の上に構築されたBigDL-LLMは、PyTorchベースのLLMの推論とファインチューニングの両方に対して堅牢なフレームワークを提供します。最近のアップデートでは、ModelScopeからの直接モデルロード、VRAMが限られたGPU上での大規模モデル実行のための初期INT2サポート、グラフィカルユーザーエクスペリエンスのためのText-Generation-WebUIとの統合など、機能拡張が強調されています。このライブラリは、Intel GPUおよびCPU上での推論遅延を実質的に高速化するSelf-Speculative Decodingも導入しています。

モデルカスタマイズに注力する開発者や研究者向けに、BigDL-LLMはIntel GPU上でのLoRA、QLoRA、DPO、QA-LoRA、ReLoRAを含む様々なファインチューニングメソッドに対して包括的なサポートを提供します。これにより、事前学習済みモデルを特定のタスクやデータセットに効率的に適応させることができます。このプロジェクトは、複数のIntel GPU上でLLaMA2-7Bを30分未満でトレーニングするなど、印象的なファインチューニング速度を実証しています。さらに、GGUF、AWQ、GPTQなどの一般的なモデル形式の直接ロードをサポートし、連続バッチ処理のためのvLLMやサービングのためのFastChatと統合されています。

BigDLエコシステムはLLMを超えて拡張され、分散データ分析およびAI(Orca)、TensorFlowおよびPyTorchの透過的アクセラレーション(Nano)、Spark上のディープラーニング(DLlib)、時系列分析(Chronos)、レコメンデーションシステム(Friesian)、セキュアAI(PPML)のためのライブラリを含んでいます。BigDL-LLMは、Intelハードウェア上でLLMのパワーを活用したい人々にとって重要なコンポーネントであり、幅広いAIアプリケーションに対して柔軟で高性能なソリューションを提供します。

BigDL LLMの主要機能

  • Intel XPU(CPU、GPU)上での最適化されたLLM推論

  • INT4、FP4、INT8、FP8量子化をサポート

  • PyTorchモデル向けの低遅延推論

  • llama.cpp、gptq、bitsandbytes、qloraを基盤

  • GGUF、AWQ、GPTQモデルの直接ロード

  • Intel GPU上での包括的なLLMファインチューニング(LoRA、QLoRA、DPO、QA-LoRA、ReLoRA)

  • 約30%の高速化を実現するSelf-Speculative Decoding

  • vLLMの連続バッチ処理をサポート

  • Intel CPUおよびGPU上でのFastChatサービング

  • ModelScopeからの直接ロード

  • 16GB VRAM GPU上での大規模LLM実行のための初期INT2サポート

  • Text-Generation-WebUIとの統合

BigDL LLMをはじめる

  1. pipでBigDL-LLMをインストールします。CPUの場合は`pip install --pre --upgrade bigdl-llm[all]`、GPUの場合は`bigdl-llm[xpu]`を使用します。

  2. `AutoModelForCausalLM.from_pretrained`を使用して、INT4最適化でHugging Face Transformersモデルをロードします。

  3. モデルパスを指定して、Intel CPU上で最適化されたモデルを実行します。

  4. モデルと入力テンソルを'xpu'デバイスに移動して、Intel GPU上で最適化されたモデルを実行します。

  5. LoRA、QLoRA、DPO、QA-LoRA、またはReLoRAのファインチューニングパラメータを設定します。

  6. 最適化されたLLMのサービングにFastChatまたはvLLMを利用します。

  7. LLMアプリケーション開発のためにLangChainと統合します。

BigDL LLMの使用例

  • 低遅延LLM推論
  • LLMファインチューニング
  • 効率的なモデルデプロイメント
  • AIアプリケーション開発
  • 限られたVRAMでの大規模モデルトレーニング
  • 高速化されたテキスト生成

BigDL LLMのFAQ

BigDL LLM のレビュー

読み込み中...

BigDL LLM に似た人気のAIツール

LiteRTは、エッジプラットフォーム上でGenAIおよびMLモデルを展開するためのGoogleの高性能オンデバイス機械学習フレームワークです。TensorFlow Liteの基盤を活かし、効率的な変換、ランタイム、最適化を提供し、数十億台のデバイスで低遅延と高いプライバシーを実現します。

MLOps・モデルデプロイ

AI フレームワーク

Intel® Neural Compressorは、PyTorch、TensorFlow、JAX向けの一般的なモデル圧縮技術を提供するオープンソースのPythonライブラリです。LLMおよびVLM向けの高度な量子化をサポートし、広範なテストを通じて様々なIntelハードウェアおよびその他のプラットフォームでのパフォーマンスを最適化します。

機械学習プラットフォーム

AI アプリ

vLLMは、大規模言語モデル(LLM)のための高スループットかつメモリ効率の良い推論および提供エンジンです。これにより、最先端のパフォーマンスを持つAIモデルの迅速な展開が可能になり、さまざまな業界のユーザーにとってLLMの提供が簡単で迅速、かつコスト効率の良いものとなります。

MLOps・モデルデプロイ

AI フレームワーク

OpenVINOは、多様なハードウェア上で高性能AIソリューションを展開するためのオープンソースツールキットです。開発者は、クラウド、AI PC、エッジデバイスでの効率的なデプロイメントをサポートし、一般的なフレームワークの生成AIおよび従来のAIモデルの両方の変換、最適化、推論実行を可能にします。

MLOps・モデルデプロイ

AI プラットフォーム

開発者が200以上の最適化されたLLMおよびマルチモーダルモデルをデプロイ、ファインチューニング、実行できるAIインフラストラクチャプラットフォームで、OpenAI互換のAPIを通じて従量課金制で提供されます。

注目MLOps・モデルデプロイ

vllm-project/vllmは、大規模言語モデル(LLM)向けに設計された高スループットかつメモリ効率の良い推論および提供エンジンです。リソース使用を最小限に抑えつつパフォーマンスを最適化し、AIや機械学習のさまざまなアプリケーションに適しています。

注目MLOps・モデルデプロイ

AI プラットフォーム

Bentoは、速度と制御のために設計された推論プラットフォームであり、あらゆるAIモデルをあらゆる場所にデプロイできます。テーラードされた最適化、効率的なスケーリング、およびAIチーム向けの合理化された運用を提供します。デプロイメントに対する完全な制御を維持しながら、推論インフラストラクチャを簡素化します。

注目MLOps・モデルデプロイ

AI フレームワーク

ONNX Runtimeは、トレーニングと推論を最適化するクロスプラットフォームの加速機械学習フレームワークです。さまざまなプログラミング言語とプラットフォームをサポートしており、高度なAI機能をアプリケーションに簡単に統合できます。

注目機械学習プラットフォーム