Deskripsi
Proyek BigDL, khususnya komponen BigDL-LLM (yang kini bertransisi ke IPEX-LLM), adalah pustaka canggih yang dirancang untuk mengoptimalkan kinerja model bahasa besar (LLM) di berbagai perangkat keras Intel, termasuk CPU dan GPU. Pustaka ini memungkinkan pengguna untuk menjalankan LLM dengan latensi yang jauh lebih rendah dengan memanfaatkan teknik kuantisasi canggih seperti INT4, FP4, INT8, dan FP8. Optimalisasi ini sangat penting untuk penerapan model AI yang kompleks secara efisien pada konfigurasi perangkat keras yang beragam.
Dibangun di atas fondasi pustaka seperti llama.cpp, gptq, bitsandbytes, dan qlora, BigDL-LLM menyediakan kerangka kerja yang kuat untuk inferensi dan fine-tuning LLM berbasis PyTorch. Pembaruan terbaru menyoroti kemampuan yang diperluas, termasuk pemuatan model langsung dari ModelScope, dukungan INT2 awal untuk menjalankan model besar pada GPU dengan VRAM terbatas, dan integrasi dengan Text-Generation-WebUI untuk pengalaman pengguna grafis. Pustaka ini juga memperkenalkan Self-Speculative Decoding, yang menawarkan percepatan praktis untuk latensi inferensi pada GPU dan CPU Intel.
Bagi pengembang dan peneliti yang berfokus pada kustomisasi model, BigDL-LLM menawarkan dukungan komprehensif untuk berbagai metode fine-tuning pada GPU Intel, termasuk LoRA, QLoRA, DPO, QA-LoRA, dan ReLoRA. Hal ini memungkinkan adaptasi model yang telah dilatih sebelumnya secara efisien untuk tugas dan kumpulan data tertentu. Proyek ini telah menunjukkan kecepatan fine-tuning yang mengesankan, seperti melatih LLaMA2-7B dalam waktu kurang dari 30 menit pada beberapa GPU Intel. Selain itu, pustaka ini mendukung pemuatan langsung format model populer seperti GGUF, AWQ, dan GPTQ, serta terintegrasi dengan vLLM untuk batching berkelanjutan dan FastChat untuk penyajian.
Ekosistem BigDL melampaui LLM, mencakup pustaka untuk analitik data terdistribusi dan AI (Orca), percepatan transparan TensorFlow dan PyTorch (Nano), deep learning pada Spark (DLlib), analisis deret waktu (Chronos), sistem rekomendasi (Friesian), dan AI yang aman (PPML). BigDL-LLM adalah komponen kunci bagi mereka yang ingin memanfaatkan kekuatan LLM pada perangkat keras Intel, menawarkan solusi yang fleksibel dan berkinerja tinggi untuk berbagai aplikasi AI.
Fitur Inti BigDL LLM
Inferensi LLM yang dioptimalkan pada Intel XPU (CPU, GPU)
Mendukung kuantisasi INT4, FP4, INT8, FP8
Inferensi latensi rendah untuk model PyTorch
Dibangun di atas llama.cpp, gptq, bitsandbytes, qlora
Pemuatan langsung model GGUF, AWQ, GPTQ
Fine-tuning LLM komprehensif pada GPU Intel (LoRA, QLoRA, DPO, QA-LoRA, ReLoRA)
Self-Speculative Decoding untuk ~30% percepatan
Mendukung batching berkelanjutan vLLM
Penyajian FastChat pada CPU dan GPU Intel
Pemuatan langsung dari ModelScope
Dukungan INT2 awal untuk LLM besar pada GPU VRAM 16GB
Integrasi dengan Text-Generation-WebUI
Memulai dengan BigDL LLM
Instal BigDL-LLM melalui pip: `pip install --pre --upgrade bigdl-llm[all]` untuk CPU atau `bigdl-llm[xpu]` untuk GPU.
Muat model Hugging Face Transformers dengan optimasi INT4 menggunakan `AutoModelForCausalLM.from_pretrained`.
Jalankan model yang dioptimalkan pada CPU Intel dengan menentukan jalur model.
Jalankan model yang dioptimalkan pada GPU Intel dengan memindahkan model dan tensor input ke perangkat 'xpu'.
Konfigurasi parameter fine-tuning untuk LoRA, QLoRA, DPO, QA-LoRA, atau ReLoRA.
Gunakan FastChat atau vLLM untuk menyajikan LLM yang dioptimalkan.
Integrasikan dengan LangChain untuk pengembangan aplikasi LLM.
Kasus Penggunaan BigDL LLM
- Inferensi LLM Latensi Rendah
- Fine-tuning LLM
- Penerapan Model yang Efisien
- Pengembangan Aplikasi AI
- Pelatihan Model Besar pada VRAM Terbatas
- Generasi Teks yang Dipercepat





