Langsung ke konten utama
ToolPotion

BigDL LLM

BigDL-LLM adalah pustaka sumber terbuka untuk menjalankan model bahasa besar (LLM) pada perangkat keras Intel XPU, dari laptop hingga GPU cloud. Pustaka ini mendukung kuantisasi INT4/FP4/INT8/FP8 untuk inferensi latensi rendah dan menawarkan kemampuan fine-tuning komprehensif untuk model PyTorch.

Kunjungi URL

Deskripsi

Proyek BigDL, khususnya komponen BigDL-LLM (yang kini bertransisi ke IPEX-LLM), adalah pustaka canggih yang dirancang untuk mengoptimalkan kinerja model bahasa besar (LLM) di berbagai perangkat keras Intel, termasuk CPU dan GPU. Pustaka ini memungkinkan pengguna untuk menjalankan LLM dengan latensi yang jauh lebih rendah dengan memanfaatkan teknik kuantisasi canggih seperti INT4, FP4, INT8, dan FP8. Optimalisasi ini sangat penting untuk penerapan model AI yang kompleks secara efisien pada konfigurasi perangkat keras yang beragam.

Dibangun di atas fondasi pustaka seperti llama.cpp, gptq, bitsandbytes, dan qlora, BigDL-LLM menyediakan kerangka kerja yang kuat untuk inferensi dan fine-tuning LLM berbasis PyTorch. Pembaruan terbaru menyoroti kemampuan yang diperluas, termasuk pemuatan model langsung dari ModelScope, dukungan INT2 awal untuk menjalankan model besar pada GPU dengan VRAM terbatas, dan integrasi dengan Text-Generation-WebUI untuk pengalaman pengguna grafis. Pustaka ini juga memperkenalkan Self-Speculative Decoding, yang menawarkan percepatan praktis untuk latensi inferensi pada GPU dan CPU Intel.

Bagi pengembang dan peneliti yang berfokus pada kustomisasi model, BigDL-LLM menawarkan dukungan komprehensif untuk berbagai metode fine-tuning pada GPU Intel, termasuk LoRA, QLoRA, DPO, QA-LoRA, dan ReLoRA. Hal ini memungkinkan adaptasi model yang telah dilatih sebelumnya secara efisien untuk tugas dan kumpulan data tertentu. Proyek ini telah menunjukkan kecepatan fine-tuning yang mengesankan, seperti melatih LLaMA2-7B dalam waktu kurang dari 30 menit pada beberapa GPU Intel. Selain itu, pustaka ini mendukung pemuatan langsung format model populer seperti GGUF, AWQ, dan GPTQ, serta terintegrasi dengan vLLM untuk batching berkelanjutan dan FastChat untuk penyajian.

Ekosistem BigDL melampaui LLM, mencakup pustaka untuk analitik data terdistribusi dan AI (Orca), percepatan transparan TensorFlow dan PyTorch (Nano), deep learning pada Spark (DLlib), analisis deret waktu (Chronos), sistem rekomendasi (Friesian), dan AI yang aman (PPML). BigDL-LLM adalah komponen kunci bagi mereka yang ingin memanfaatkan kekuatan LLM pada perangkat keras Intel, menawarkan solusi yang fleksibel dan berkinerja tinggi untuk berbagai aplikasi AI.

Fitur Inti BigDL LLM

  • Inferensi LLM yang dioptimalkan pada Intel XPU (CPU, GPU)

  • Mendukung kuantisasi INT4, FP4, INT8, FP8

  • Inferensi latensi rendah untuk model PyTorch

  • Dibangun di atas llama.cpp, gptq, bitsandbytes, qlora

  • Pemuatan langsung model GGUF, AWQ, GPTQ

  • Fine-tuning LLM komprehensif pada GPU Intel (LoRA, QLoRA, DPO, QA-LoRA, ReLoRA)

  • Self-Speculative Decoding untuk ~30% percepatan

  • Mendukung batching berkelanjutan vLLM

  • Penyajian FastChat pada CPU dan GPU Intel

  • Pemuatan langsung dari ModelScope

  • Dukungan INT2 awal untuk LLM besar pada GPU VRAM 16GB

  • Integrasi dengan Text-Generation-WebUI

Memulai dengan BigDL LLM

  1. Instal BigDL-LLM melalui pip: `pip install --pre --upgrade bigdl-llm[all]` untuk CPU atau `bigdl-llm[xpu]` untuk GPU.

  2. Muat model Hugging Face Transformers dengan optimasi INT4 menggunakan `AutoModelForCausalLM.from_pretrained`.

  3. Jalankan model yang dioptimalkan pada CPU Intel dengan menentukan jalur model.

  4. Jalankan model yang dioptimalkan pada GPU Intel dengan memindahkan model dan tensor input ke perangkat 'xpu'.

  5. Konfigurasi parameter fine-tuning untuk LoRA, QLoRA, DPO, QA-LoRA, atau ReLoRA.

  6. Gunakan FastChat atau vLLM untuk menyajikan LLM yang dioptimalkan.

  7. Integrasikan dengan LangChain untuk pengembangan aplikasi LLM.

Kasus Penggunaan BigDL LLM

  • Inferensi LLM Latensi Rendah
  • Fine-tuning LLM
  • Penerapan Model yang Efisien
  • Pengembangan Aplikasi AI
  • Pelatihan Model Besar pada VRAM Terbatas
  • Generasi Teks yang Dipercepat

FAQ dari BigDL LLM

Ulasan BigDL LLM

Memuat...

Alat AI Populer Seperti BigDL LLM

LiteRT adalah kerangka kerja machine learning di perangkat berkinerja tinggi dari Google untuk menerapkan model GenAI dan ML pada platform edge. Kerangka kerja ini menawarkan…

MLOps & Penerapan Model

Intel® Neural Compressor adalah pustaka Python open-source yang menawarkan teknik kompresi model populer untuk PyTorch, TensorFlow, dan JAX. Pustaka ini mendukung kuantisasi…

Platform Machine Learning

Aplikasi AI

vLLM adalah mesin inferensi dan penyajian yang efisien dalam memori dan throughput tinggi untuk Model Bahasa Besar (LLM). Ini memungkinkan penerapan model AI yang lebih cepat…

MLOps & Penerapan Model

Framework AI

OpenVINO adalah toolkit open-source untuk menerapkan solusi AI berkinerja tinggi di berbagai perangkat keras. Ini memungkinkan pengembang untuk mengonversi, mengoptimalkan, dan…

MLOps & Penerapan Model

Platform AI

Platform infrastruktur AI untuk pengembang untuk menerapkan, menyempurnakan, dan menjalankan 200+ LLM dan model multimodal yang dioptimalkan melalui satu API yang kompatibel…

UnggulanMLOps & Penerapan Model

vllm-project/vllm adalah mesin inferensi dan penyajian yang berkecepatan tinggi dan efisien dalam penggunaan memori, dirancang untuk model bahasa besar (LLM). Ini mengoptimalkan…

UnggulanMLOps & Penerapan Model

Bento adalah platform inferensi yang dirancang untuk kecepatan dan kontrol, memungkinkan Anda menerapkan model AI apa pun di mana saja. Platform ini menawarkan optimasi yang…

UnggulanMLOps & Penerapan Model

Framework AI

ONNX Runtime adalah kerangka kerja pembelajaran mesin yang dipercepat lintas platform yang mengoptimalkan pelatihan dan inferensi. Ini mendukung berbagai bahasa pemrograman dan…

UnggulanPlatform Machine Learning